TLDR: — Верю ли я, что OpenAI тренировались на решениях этих задач? Нет. — Верю ли я, что OpenAI тренировались на условиях конкретно этих задач? Тоже нет. — Как они могли использовать эти данные и могло ли это увеличить их оценку? Думаю, что было 2-5 моделей-кандидатов, обученных чуть по разному (и все из них не видели FrontierMath), и что их качество могли замерять на бенчмарке для оценки эффективности, и по этим замерам делать выводы, что работает лучше, а что нет. Это в некотором смысле лёгкое переобучение, так как мы подсматриваем в финальные результаты. Но я не думаю, что без этого качество упало бы ниже 20%, да даже если 15% — это всё равно существенный рывок со старых 2% у других моделей — Альтернативно, я думаю, что некоторые из задач могли использоваться для указания областей математики, в которых OpenAI нужно собрать свои данные. То есть в некотором смысле достаточно обобщённая статистика о типах задач, которая... по идее так и так доступна (в статье точно давали срез). И вот OpenAI просто дали цель своим разметчикам-контракторам делать больше задач из этих разделов. — про ARC OpenAI честно сказали «мы взяли 300 публично доступных задач и добавили в тренировку», а тут не сказали ничего. Я думаю, что это указатель не на их мухлёж, а на то, что они использовали 0 задач из FrontierMath. И последнее: FrontierMath имеет отложенную выборку, которая недоступна OpenAI. Авторы сказали, что «OpenAI их полностью поддерживали в создании этой отложенной непубличной части». Жаль правда что сейчас не померили и опубликовали качество там, уже полностью взакрытую, чтоб поставить точку в вопросе.