TLDR: — Верю ли я, что OpenAI тренировались на решениях этих задач? Нет. — Верю ли я, что OpenAI тренировались на условиях конкретно этих задач? Тоже нет. — Как они могли использовать эти данные и могло ли это увеличить их оценку? Думаю, что было 2-5 моделей-кандидатов, обученных чуть по разному (и все из них не видели FrontierMath), и что их качество могли замерять на бенчмарке для оценки эффективности, и по этим замерам делать выводы, что работает лучше, а что нет. Это в некотором смысле лёгкое переобучение, так как мы подсматриваем в финальные результаты. Но я не думаю, что без этого качество упало бы ниже 20%, да даже если 15% — это всё равно существенный рывок со старых 2% у других моделей — Альтернативно, я думаю, что некоторые из задач могли использоваться для указания областей математики, в которых OpenAI нужно собрать свои данные. То есть в некотором смысле достаточно обобщённая статистика о типах задач, которая... по идее так и так доступна (в статье точно давали срез). И вот OpenAI просто дали цель своим разметчикам-контракторам делать больше задач из этих разделов. — про ARC OpenAI честно сказали «мы взяли 300 публично доступных задач и добавили в тренировку», а тут не сказали ничего. Я думаю, что это указатель не на их мухлёж, а на то, что они использовали 0 задач из FrontierMath. И последнее: FrontierMath имеет отложенную выборку, которая недоступна OpenAI. Авторы сказали, что «OpenAI их полностью поддерживали в создании этой отложенной непубличной части». Жаль правда что сейчас не померили и опубликовали качество там, уже полностью взакрытую, чтоб поставить точку в вопросе.
TLDR: — Верю ли я, что OpenAI тренировались на решениях этих задач? Нет. — Верю…
Из этого канала
- #2234Соврал, не последнее. Вот мнение соавтора (и достаточно уважаемого…
Соврал, не последнее. Вот мнение соавтора (и достаточно уважаемого исследователя, у него есть другие клёвые работы) вышеупомянутого бенчмарка SWE Bench…
- #2235Mood: https://youtu.be/j5GgGdSwjE?t=29 Пояснение: увидел в твиттере от нонейма…
Mood: https://youtu.be/j5GgGdSwjE?t=29 Пояснение: увидел в твиттере от нонейма (я ни разу его не видел) наброс, что якобы в OpenAI уже есть o4-alpha, и что это…
- #2236Сегодня-завтра DeepSeek должны разродиться полноценной ризонинг-моделью R1,…
Сегодня-завтра DeepSeek должны разродиться полноценной ризонинг-моделью R1, веса уже появились на HuggingFace. Надеюсь, что будет статья + замеры метрик.
- #2232Новая AI драма! Помните датасет/бенчмарк FrontierMath, про который я писал тут?…
Новая AI драма! Помните датасет/бенчмарк FrontierMath, про который я писал тут? В нём собраны сложные и очень сложные задачи, которые (пока) не под силу LLM…
- #2230What does it take to be an AI skeptic in 2025? (я не смог придумать звучное…
What does it take to be an AI skeptic in 2025? (я не смог придумать звучное название поста на русском, предлагайте варианты в комментариях!) Есть такой AI…