По поводу этой драмы высказался уважаемый исследователь Nat McAleese: — мы вообще не использовали данные FrontierMath для разработки o1 или o3 — мы не обучались на каких-либо данных, полученных из FrontierMath, на каких-либо вдохновленных теми задачами данных или на чём-то, что предназначено конкретнодля FrontierMath — я в этом абсолютно уверен, потому что мы скачали FrontierMath для наших оценок сильно позже того, когда данные для обучения были заморожены (утверждены/финализированы), и посмотрели на результаты o3 FrontierMath только после того, как была выбрана финальная модель [прим.: я спеулировал, что OpenAI могли получить несколько моделей и выбирать лучшую через замеры на FrontierMath, но даже этого не делали] — мне жаль, что возникла путаница, так как o3 — невероятное достижение, а FrontierMath — отличный способ оценки моделей. Мы усердно работаем над выпуском o3 и надеемся, что релиз модели развеет все опасения по поводу её качества! Я — верю. __А вы?__