Новая AI драма! Помните датасет/бенчмарк FrontierMath, про который я писал тут? В нём собраны сложные и очень сложные задачи, которые (пока) не под силу LLM (до о3). В момент релиза лучший показатель был 2% решённых задач (o1 тогда ещё не вышла, была o1-preview), но в момент анонса o3 OpenAI заявили, что их модель решает ~8% задач, а с агрегацией нескольких решений (предположительно, 64) — 25.2%. Большой скачок с 2%! Выяснилось, что создание этого бенчмарка было проспонсировано (как минимум частично) OpenAI, и что они получили и задачи, и решения. Компания запретила Epoch.AI, создателям датасета, разглашать этот факт до анонса o3, и потому не получилось прозрачной коммуникации. И конечно же люди начали исходить слюной, заявляя, что нас всех обманули и теперь ясно как именно модель стала «лучше», и что Altman вообще-то гей, и это многое объясняет (я не шучу и не преувеличиваю). Но есть ли реальная причина как-то менять своё восприятие в свете этой информации? ❓Я думаю, что нет. Лаборатории не первый раз спонсируют и/или делегируют создание независимых бенчмарков для оценки и сравнения своих моделей. Они заинтересованы в честном замере метрик для себя, для того, чтобы понимать, что реально работает, а что нет. Я прочитал много комментов в твиттере, в телеге, на ютубе, на реддите, и никто нигде не упомянул и никак не вспомнил факт, что... ставший стандартом сравнения агентов и навыков программирования у LLM датасет SWE Bench Verified, например, тоже был сделан в коллаборации с OpenAI, и что у них есть и все задачи, и все решения. Однако как все с августа начали на нём замеряться, так и продолжают. Я слышал критику, что используются публичные популярные репозитории с кодом, так что в теории модели могут часть ответов запомнить/знать, но ни в коей мере то, что «модели OpenAI хорошо себя там показывают потому что ну понятно же, они сами данные собирали, и ответы есть». Хотя ситуация ровно та же самая, кроме факта, что в этот раз не было публичного анонса (что я порицаю и не считаю хорошей практикой). И до этого OpenAI создали и выпустили сами множество датасетов, которые существовали годы: HumanEval, GSM8k из самых популярных. Однако независимые проверки (например) на других задачах схожего типа зачастую показывали, что их модели не переобучены, и что на новых задачах, которых точно не было до этого, качество не хуже. Даже вот в том посте с примером, на который я ссылаюсь выше, качество LLAMA-3 падает больше на GSM1k, чем у GPT-4o, хотя если верить их статье, они чистили свои данные как только могли, чтобы не было утечек. В статье писали, что данные для предтренировки были обработаны отдельной командой, которая была мотивирована не допустить утечки данных (по моему больше 150 бенчмарков из данных выкинули). И даже после этого всё равно оставались признаки «обучения» на некоторых бенчмарках, хотя я не верю, что это могло быть сделано со злым умыслом. Epoch.ai сказали, что у них есть вербальное соглашение о том, что OpenAI не тренируются на задачах FrontierMath