Новая AI драма! Помните датасет/бенчмарк FrontierMath, про который я писал тут? В нём собраны сложные и очень сложные задачи, которые (пока) не под силу LLM (до о3). В момент релиза лучший показатель был 2% решённых задач (o1 тогда ещё не вышла, была o1-preview), но в момент анонса o3 OpenAI заявили, что их модель решает ~8% задач, а с агрегацией нескольких решений (предположительно, 64) — 25.2%. Большой скачок с 2%! Выяснилось, что создание этого бенчмарка было проспонсировано (как минимум частично) OpenAI, и что они получили и задачи, и решения. Компания запретила Epoch.AI, создателям датасета, разглашать этот факт до анонса o3, и потому не получилось прозрачной коммуникации. И конечно же люди начали исходить слюной, заявляя, что нас всех обманули и теперь ясно как именно модель стала «лучше», и что Altman вообще-то гей, и это многое объясняет (я не шучу и не преувеличиваю). Но есть ли реальная причина как-то менять своё восприятие в свете этой информации? ❓Я думаю, что нет. Лаборатории не первый раз спонсируют и/или делегируют создание независимых бенчмарков для оценки и сравнения своих моделей. Они заинтересованы в честном замере метрик для себя, для того, чтобы понимать, что реально работает, а что нет. Я прочитал много комментов в твиттере, в телеге, на ютубе, на реддите, и никто нигде не упомянул и никак не вспомнил факт, что... ставший стандартом сравнения агентов и навыков программирования у LLM датасет SWE Bench Verified, например, тоже был сделан в коллаборации с OpenAI, и что у них есть и все задачи, и все решения. Однако как все с августа начали на нём замеряться, так и продолжают. Я слышал критику, что используются публичные популярные репозитории с кодом, так что в теории модели могут часть ответов запомнить/знать, но ни в коей мере то, что «модели OpenAI хорошо себя там показывают потому что ну понятно же, они сами данные собирали, и ответы есть». Хотя ситуация ровно та же самая, кроме факта, что в этот раз не было публичного анонса (что я порицаю и не считаю хорошей практикой). И до этого OpenAI создали и выпустили сами множество датасетов, которые существовали годы: HumanEval, GSM8k из самых популярных. Однако независимые проверки (например) на других задачах схожего типа зачастую показывали, что их модели не переобучены, и что на новых задачах, которых точно не было до этого, качество не хуже. Даже вот в том посте с примером, на который я ссылаюсь выше, качество LLAMA-3 падает больше на GSM1k, чем у GPT-4o, хотя если верить их статье, они чистили свои данные как только могли, чтобы не было утечек. В статье писали, что данные для предтренировки были обработаны отдельной командой, которая была мотивирована не допустить утечки данных (по моему больше 150 бенчмарков из данных выкинули). И даже после этого всё равно оставались признаки «обучения» на некоторых бенчмарках, хотя я не верю, что это могло быть сделано со злым умыслом. Epoch.ai сказали, что у них есть вербальное соглашение о том, что OpenAI не тренируются на задачах FrontierMath
Новая AI драма! Помните датасет/бенчмарк FrontierMath, про который я писал тут?…
Из этого канала
- #2233TLDR: — Верю ли я, что OpenAI тренировались на решениях этих задач? Нет. — Верю…
TLDR: — Верю ли я, что OpenAI тренировались на решениях этих задач? Нет. — Верю ли я, что OpenAI тренировались на условиях конкретно этих задач? Тоже нет.
- #2234Соврал, не последнее. Вот мнение соавтора (и достаточно уважаемого…
Соврал, не последнее. Вот мнение соавтора (и достаточно уважаемого исследователя, у него есть другие клёвые работы) вышеупомянутого бенчмарка SWE Bench…
- #2235Mood: https://youtu.be/j5GgGdSwjE?t=29 Пояснение: увидел в твиттере от нонейма…
Mood: https://youtu.be/j5GgGdSwjE?t=29 Пояснение: увидел в твиттере от нонейма (я ни разу его не видел) наброс, что якобы в OpenAI уже есть o4-alpha, и что это…
- #2230What does it take to be an AI skeptic in 2025? (я не смог придумать звучное…
What does it take to be an AI skeptic in 2025? (я не смог придумать звучное название поста на русском, предлагайте варианты в комментариях!) Есть такой AI…
- #2228Paul Schrader, сценарист фильмов «Таксист» и «Бешеный бык» (за режиссёрством…
Paul Schrader, сценарист фильмов «Таксист» и «Бешеный бык» (за режиссёрством Martin «🖐😶🤚» Scorsese ), пишет в фейсбуке: — Я только что осознал что AI умнее…