Competitive Programming with Large Reasoning Models OpenAI выпустили скорее не статью, а отчёт о том, как они замеряют прогресс в программировании у моделей, и сравнивают o3 с o1 и o1-ioi (системой, которая была заточена на решение международной олимпиады по информатике; там были свои методы с агрегацией и фильтрацией решений). Большая часть метрик уже была показана ранее, тут больших сюрпризов нет, просто добавили деталей. Одна из важнейших — это то, как сравнивают решения LLM с решениями людей в соревнованиях, где играет роль время отправки решения и количество ошибок. Недостаточно просто написать код, который прошёл все тесты — нужно это делать как можно быстрее. Понятно, что кластер с 100,000 видеокарт сгенерирует пару сотен решений быстрее, чем человек, так ещё и одновременно для всех задач сразу — как быть? OpenAI выбрали, как мне кажется, достаточно резонную стратегию (тут и ниже — в контексте оценки рейтинга CodeForces): они использовали медианное время отправки и количество попыток среди всех людей, кто решил задачу. Таким образом полученные оценки слегка занижены относительно того, если бы OpenAI гнались за максимальным скором, и считали, что отправляют решения быстрее всех (или хотя бы как топ-10-20%, а не медианный). <тут я должен напомнить что при таком замере рейтинг o3 достигает 2724, или 99.8 перцентиль, то есть лучше неё очень малая доля участников> === Другая интересная вещь: o3 во время рассуждений может пользоваться инструментами (o1 пока нет), то есть запускать код, который сама пишет, без отправки решения. Почти наверняка модель так обучалась. На картинке вы видите одну из стратегий, обнаруженную o3 во время тренировки и применяемую тут: для проблем, где проверка нетривиальна, она часто пишет простые решения методом перебора — жертвуя эффективностью ради правильности — затем перекрестно проверяет результаты с помощью своих более оптимизированных алгоритмических реализаций. Этот самодельный механизм проверки позволяет o3 выявлять потенциальные ошибки и повышать надежность своих решений. Говоря проще код на картинке — это проверка в духе «так, вот тут решение, в котором я точно уверен, а вот моё оптимизированное. Не продолбался ли я где-то? Ща проверим на сотне случайных примеров». И всё это в рамках цепочки рассуждений. Благодаря DeepSeek R1 мы знаем, что OpenAI не врали, когда говорили, что модель сама по себе придумывает паттерны рассуждений, без вмешательства человека и явного прописывания таких стратегий. Скорее всего, этот пример тоже относится к таким — модель во время обучения просто поняла, что такие проверки позволяют чаще справляться с задачами, меньше ошибаться (что вполне логично), и начала применять технику. Ведь по сути это та же самопроверка, которую мы видели для математических задач, просто с отдельным запуском кода. Absolute Cinema 🖐😶🤚
Competitive Programming with Large Reasoning Models OpenAI выпустили скорее не…
Из этого канала
- #2305Sama написал, что Orion — это GPT-4.5, а не GPT-5 🤯…
Sama написал, что Orion — это GPT-4.5, а не GPT-5 🤯 https://x.com/sama/status/1889755723078443244 > “We will no longer ship o3 as a standalone model.” 😱
- #2306Сэм Альтман рассказал о дальнейших планах OpenAI. Планируют выпустить GPT-4.5…
Сэм Альтман рассказал о дальнейших планах OpenAI. Планируют выпустить GPT-4.5 (подтвердили, что это Orion) в ближайшие недели — это будет последняя “нелинейно…
- #2307"https://youtu.be/v0gjIRyCY У Dwarkesh вышел подкаст с двумя глыбами Google —…
"https://youtu.be/v0gjIRyCY У Dwarkesh вышел подкаст с двумя глыбами Google — легендарным Jeff ""Norris"" Dean и Noam Shazeer, сотрудником, за которого…
- #2303Серьёзный вопрос к некоторым представителям моей аудитории Зачастую под анонсом…
Серьёзный вопрос к некоторым представителям моей аудитории Зачастую под анонсом моделей, технологий, блогпостов, эссе, да хоть чего, касающегося лидеров…
- #2302Краткая сводка с AI-полей На встрече OpenAI Dev Meetup в Лондоне 10-го февраля…
Краткая сводка с AI-полей На встрече OpenAI Dev Meetup в Лондоне 10-го февраля Sama отвечал на вопросы: — «Я думаю, нам нужно внедрить оплату по факту…