Нашёл интересный график. Есть такой бенчмарк, GPQA, в нём достаточно сложные вопросы (...были) и 4 варианта ответа, из которых надо выбрать. По сути, тест. Насколько проседают модели, если не давать им варианты ответа и просить выбрать, а просто давать генерировать решение и ответ, а затем извлекать его и проверять? Модели, ожидаемо, проседают, но из списка всех LLM, которые протестировали авторы, в топе o4-mini-high, а Grok 4 внезапно падает даже ниже Grok 3 mini. Источник
Нашёл интересный график. Есть такой бенчмарк, GPQA, в нём достаточно сложные…
Из этого канала
- #2650В фильмах/играх/сериалах про зомби мне нравится смотреть на описание того, как…
В фильмах/играх/сериалах про зомби мне нравится смотреть на описание того, как мир спотыкается и валится в пропасть .
- #2651На неделе MoonshotAI представили Kimi-K2, огромную модель на 1 триллион…
На неделе MoonshotAI представили Kimi-K2, огромную модель на 1 триллион параметров, оптимизированную на агентские задачи.
- #2652Kimi-VL
Kimi-VL
- #2648"xAI впервые вышла в лидеры рынка ИИ — Grok 4 набрал 73 балла в Intelligence…
"xAI впервые вышла в лидеры рынка ИИ — Grok 4 набрал 73 балла в Intelligence Index, опередив o3 (70), Gemini 2.5 Pro (70) и Claude 4 Opus (64).
- #2643Из свежего поста Astralcodexten: Мы всё ещё ведем тот же спор: является ли ИИ…
Из свежего поста Astralcodexten: Мы всё ещё ведем тот же спор: является ли ИИ «стохастическим попугаем», который никогда не сможет выйти за рамки «простого…