Как две галочки в API утроили результат GPT-5.6 на ARC-AGI-3 Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку. Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело. Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака. Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скользящего окна по мере роста истории любые старые действия становились для модели невидимыми. Но дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались. А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%. Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
Как две галочки в API утроили результат GPT-5.6 на ARC-AGI-3 Очень занятное…
Из этого канала
- #9640OpenAI существенно понизили цены на GPT-5.6 — На Luna – на 80% (цена теперь…
OpenAI существенно понизили цены на GPT-5.6 — На Luna – на 80% (цена теперь 0.20$/1.20$ за миллион i/o) — На Terra – на 20% (теперь 2$/12$ за миллион i/o) — На…
- #964124 сентября Yandex Cloud проведёт Yandex Scale 2026 — флагманскую…
24 сентября Yandex Cloud проведёт Yandex Scale 2026 — флагманскую технологическую конференцию года, посвящённую облачным технологиям, инфраструктуре и…
- #9642DeepSeek обновили DeepSeek-V4-Flash: теперь модель близка по метрикам к Opus…
DeepSeek обновили DeepSeek-V4-Flash: теперь модель близка по метрикам к Opus 4.8! Модель вышла из превью и уже появилась в официальном API. Бенчмарки – выше.
- #9638451 токен по Фаренгейту: правда ли, что ИИ-компании уничтожают книги Помните…
451 токен по Фаренгейту: правда ли, что ИИ-компании уничтожают книги Помните громкий суд Anthropic по делу нарушения авторских прав? Мы напомним: чуть меньше…
- #9637Yandex B2B Tech представила универсального ИИ-агента для бизнеса, который…
Yandex B2B Tech представила универсального ИИ-агента для бизнеса, который сможет автоматизировать до 30–50% рутинных задач офисных сотрудников.