Вместе с более широким релизом DeepSearch, теперь доступного и пользователям с подпиской за $20, OpenAI выпустили системную карточку о модели — в ней есть пара интересных моментов. Первое: что это за модель? Уже говорилось, что в её основе лежит o3, крупная версия продвинутой рассуждающей модели (которая, судя по всему, всё ещё базируется на GPT-4o, а не на Orion). «Модель основана на ранней версии OpenAI o3 и оптимизирована для просмотра веб-страниц. Она была обучена на новых наборах данных браузинга, созданных специально для исследовательских сценариев использования. Модель изучила основные возможности просмотра страниц (поиск, нажатие, прокрутка, понимание файлов), как использовать инструмент Python в изолированной среде (для проведения вычислений, анализа данных и построения графиков), и как рассуждать и синтезировать большое количество веб-сайтов, чтобы находить определенные фрагменты информации или писать комплексные отчеты с помощью обучения с подкреплением по этим задачам просмотра» TLDR: это o3, у которой ещё лучше длинный контекст работает, и она лучше пользуется инструментами, включая Python. Это подводит нас к тому, что даже если ей отключить интернет, то, возможно, на передовых бенчмарках модель покажет себя ещё лучше, чем o3 (ну или по крайней мере не хуже). Второе: а вот и бенчмарки! В статье их много, но хочу обратить внимание на два: 1) Внутренний бенчмарк OpenAI по написанию кода в Pull Request на реальных задачах, которые решали инженеры и исследователи компании. Этот код и недоступен в интернете (так как репозиторий закрыт), и не участвовал в тренировке модели. Для каждой задачи отдельно прописаны описание, набор тестов и эталонное решение. GPT-4o решала всего 6% (задачи там по идее сильно сложнее, чем в SWE bench, так что ожидаемо), o1 уже 12%, а DeepResearch с o3 в основе разогналась аж до 42%. И это БЕЗ браузинга, то есть она даже не может подсмотреть описание популярных багов в библиотеках или прогуглить какую-то ошибку, заглянуть на StackOverflow. Это результат сильно превосходит мои ожидания. Да, моделька закрывает половину рабочих задач (из некоторого подмножества) программиситов OpenAI, а чо таково) 2) Недавно выпущенный OpenAI бенчмарк SWE-Lancer. Я про него написал заметки, но не опубликовал пост (может, ещё будет). В нём взяли 1500 задач компании Expensify, которая ведёт бизнес по принципу «фронтенд и части бекенда мы отдаём на произвол сообщества; за каждую закрытую задачу платим деньги». Это прям реальные задачи, за которые действительно заплатили фрилансерам, некоторые из задач дешёвые, $20 за пятиминутный фикс, другие тяжелые, стоят больше $30'000 и решались несколько недель. Суммарно фонд выплат составил ~$500k. Так вот модели соревнуются не за решение абстрактных равноценных задач, а за зарабатывание как можно большей суммы из этого полумиллиона. Можно решить 2/3 задач, но самых дешёвых — и метрика не будет высокой. Sonnet 3.5 в бенчмарке обогнал o1, заработав $58k из $236k (сумма не $500k потому что это половинка, которая опубликована для всех; вторая осталась закрытой) — это прям сами OpenAI намерили, сказали, что модель Anthropic лучше (а это даже не Sonnet 3.7!). А вот DeepResearch БЕЗ ИНТЕРНЕТА (то есть не может подглядеть как там реальное решение выглядело) набирает $107k из $236k, почти вдвое больше. Тоже впечатляет, но видно, что самые дорогие задачки пока не берутся. Очен ждом GPT-5 🙂