9 дней назад прошла международная олимпиада по математике, а 5 дней назад подвели результаты. Я хотел подождать 7 дней, так как в прошлом году был маленький скандал, где ИИ-компании опубликовали свои результаты почти одновременно с результатами школьников, хотя организаторы хотели подождать неделю. Так что возможно в понедельник-вторник будут анонсы. Но в системной карточке Opus 5 написано, что они дали модели порешать все 6 задач, каждую запускали 4 независимых раза с максимальной длинной рассуждений. Запускали даже не в Claude Code — без любой обвязки и инструментов, никакого поиска по интернету или написания питон-кода. Автоматический грейдер на основе нескольких моделей оценил все 24 решения как корректные. Затем люди-эксперты взяли по 1 решению для каждой из 6 задач, оценили по официальной шкале, и насчитали максимальный балл, 42 из 42. Золотая медаль в этом году начиналась с 29. Я видел в твиттере, что любители уже погоняли GPT-5.6-Sol-Pro, просто Sol и Kimi K3 на этих же задачах, и там тоже все или почти все (в случае Kimi) решения корректные. Так что само по себе то, что модель настолько хороша, что берёт золотую медаль в некогда безумно сложном для машин соревновании, где ещё в 2024-м году использовалось две разные системы (одна — специально под геометрию) и тысячи генераций, часы работы... уже никого не удивляет, да? 😳 А что будет через два года 👀
9 дней назад прошла международная олимпиада по математике, а 5 дней назад…
Из этого канала
- #3839Ночью прошёл тринадцатый тестовый полёт Starship. Это второй полёт полностью…
Ночью прошёл тринадцатый тестовый полёт Starship. Это второй полёт полностью обновлённой системы третьей версии.
- #3834Вышел Opus 5, уже доступен в Claude Code и на сайте. Модель во многом... лучше…
Вышел Opus 5, уже доступен в Claude Code и на сайте. Модель во многом... лучше Fable 5 😎 Даже на Frontier-Bench, про который я писал сегодня — уже +9%.
- #3833Компании с картинки подписали совместное письмо «Открытые веса и лидерство…
Компании с картинки подписали совместное письмо «Открытые веса и лидерство Америки в ИИ» (из заметных там нет двух: OpenAI и Anthropic).
- #3830Популярный бенчмарк TerminalBench хотел обновиться до третьей версии, задачи…
Популярный бенчмарк TerminalBench хотел обновиться до третьей версии, задачи для которой собирали с начала весны, но вместо этого превратился во FrontierBench.