Пред-предпоследний пост перед постом про DeepSeek! В карточке модели o3-mini (вот pdf) OpenAI традиционно проводят множество тестов на безопасность и потенциально опасные навыки модели (умение выпрашивать деньги, эксплуатировать уязвимости в коде, саморазмножаться). Там само по себе много интересной информации, в частности то, что модель o3-mini гораздо более эффективна в манипуляциях и социальной инженерии (правда оценки тут почти везде автоматизированы и не затрагивают людей). Но хотел обратить внимание на другое. Уже много раз писал про бенчмарк SWE Bench Verified, где модели пытаются генерировать изменения для кода на уровне целого большого проекта, а не маленького приложения на 1-2 файла. На бенчмарке мы уже год отслеживает прогресс, и то что начиналось как 3-5% уже превратилось в 65%+. Однако загвоздка в том, что почти наверняка модели были натренированы на репозиториях, на которых производится оценка — и даже если модели не знают конкретный ответ на задачу, они в целом чувствуют себя увереннее в «виденной» ими кодовой базе. И OpenAI собрали аналогичный бенчмарк, но на основе внутреннего репозитория. Про его структуру и сложность мы ничего не знаем, никаких деталей — даже количества задач — нет (но если прикинуть по процентам в статье, то получается что их не меньше 60; моя ставка что больше 200). Важно, что это прям настоящие задачи, которые делают высокооплачиваемые инженеры и исследователи непосредственно при работе в OpenAI. Ближе к «реальным рабочим задачам исследований AI» некуда. На картинке: o1 набирает 12%, o3-mini из-за каких-то ошибок форматирования набирает 0%, но это скорее результат сбора отчёта на скорую руку и/или нежелание вносить конкретные правки в инструмент тестирования (потому что на самом SWE Bench Verified модель супер клёво себя показывает). Сложно понять, как интерпретировать 12% — может это были самые простые изменения в духе «добавил тут и там новое название переменной» или «исправил очевидный баг». Хотя скорее всего нет, и отбирали реально важные-сложные-интересные задачки. И вот среди них 12% решается. o3 наверное перескочит 20-25% — а это вообще-то очень много: представьте, что в такой компании, как OpenAI, 25% задач на программирование закрываются моделью. Будем следить за этой цифрой в ближайших релизах, у какой-нибудь o4 там снова может получиться такая оценка, что сложно будет поверить)
Пред-предпоследний пост перед постом про DeepSeek! В карточке модели o3-mini…
Из этого канала
- #2290Предпоследний пост перед постом про DeepSeek! Как я писал, 30-го января Sama и…
Предпоследний пост перед постом про DeepSeek! Как я писал, 30-го января Sama и несколько сотрудников OpenAI были в Белом доме на закрытой встрече с…
- #2291gptPhone: начало post-mobile эпохи? OpenAI планирует выпустить новое…
gptPhone: начало post-mobile эпохи? OpenAI планирует выпустить новое «GenAI-устройство» на замену смартфону.
- #2292Как мне o1 Pro с шеей помогла >36 лет, почти 2 метра роста >в ~33 много сидел…
Как мне o1 Pro с шеей помогла >36 лет, почти 2 метра роста >в ~33 много сидел за ноутом в позе буквы G и заработал хронические боли в шее (ригидность шеи)…
- #2287По предварительной информации лимит использования o3-mini для бесплатных юзеров…
По предварительной информации лимит использования o3-mini для бесплатных юзеров составляет 10 сообщений в 4 часа — по крайней мере в чате два человека получили…
- #2286Помните я писал про бенчмарк «Быки и коровы», где нужно угадывать, какое…
Помните я писал про бенчмарк «Быки и коровы», где нужно угадывать, какое четырёхзначное число загадал пользователь? (ответы и валидация автоматические) Ну так…