"xAI впервые вышла в лидеры рынка ИИ — Grok 4 набрал 73 балла в Intelligence Index, опередив o3 (70), Gemini 2.5 Pro (70) и Claude 4 Opus (64). Это первый случай, когда модель не из ""большой тройки"" (OpenAI, Google, Anthropic) занимает первое место в комплексном рейтинге Artificial Analysis. Grok 4 показал рекордные 88% в GPQA Diamond и 94% в AIME 2024. Это reasoning-модель, которая ""думает"" перед ответом, хотя сами токены рассуждений через API не передаются. Цена $3/$15 за миллион входящих/исходящих токенов идентична Claude 4 Sonnet, но выше чем у Gemini 2.5 Pro ($1.25/$10) и o3 ($2/$8). Скорость 75 токенов в секунду уступает o3 (188) и Gemini 2.5 Pro (142), но опережает Claude 4 Opus Thinking (66). Контекстное окно 256K токенов — меньше чем у Gemini 2.5 Pro (1M), но больше чем у конкурентов (200K у Claude и o3, 128K у R1). Поддерживает текст, изображения, вызовы функций и структурированные выходы. Правда, Маск прямо на презентации признал, что модель пока плохо справляется с мультимодальным режимом, но это будет исправлено в будущем. https://x.com/artificialanlys/status/1943166841150644622"
"xAI впервые вышла в лидеры рынка ИИ — Grok 4 набрал 73 балла в Intelligence…
Из этого канала
- #2649Нашёл интересный график. Есть такой бенчмарк, GPQA, в нём достаточно сложные…
Нашёл интересный график. Есть такой бенчмарк, GPQA, в нём достаточно сложные вопросы (...были) и 4 варианта ответа, из которых надо выбрать. По сути, тест.
- #2650В фильмах/играх/сериалах про зомби мне нравится смотреть на описание того, как…
В фильмах/играх/сериалах про зомби мне нравится смотреть на описание того, как мир спотыкается и валится в пропасть .
- #2651На неделе MoonshotAI представили Kimi-K2, огромную модель на 1 триллион…
На неделе MoonshotAI представили Kimi-K2, огромную модель на 1 триллион параметров, оптимизированную на агентские задачи.
- #2643Из свежего поста Astralcodexten: Мы всё ещё ведем тот же спор: является ли ИИ…
Из свежего поста Astralcodexten: Мы всё ещё ведем тот же спор: является ли ИИ «стохастическим попугаем», который никогда не сможет выйти за рамки «простого…
- #26421. OpenAI планируют на следующей неделе выложить модель, сравнимую с o3-mini, в…
1. OpenAI планируют на следующей неделе выложить модель, сравнимую с o3-mini, в открытый доступ. 2.