Немного подвожу итоги вчерашней презентации. Кажется, сами OpenAI не восприняли её супер-серьёзно: — никаких C-levels или VP (типа моего любимца Mark Chen) на трансляции — блогпост примерно в 3 раза короче, чем у GPT-4, и количество замеров тоже куда меньше — до этого в новостях была ровно одна (1) утечка о релизе на этой неделе, и никаких деталей. Про 4o и o1 было больше, потому что про проекты внутри говорили больше Частично это может быть связано с тем, что в компании понимают, что на фоне reasoning-моделей приросты могут казаться блеклыми (но не обманывайтесь). Я писал, что жду от анонса большого количества практических примеров того, что модель лучше, и журил за их отсутствие Google и xAI. Чтоб выразить в качестве оценки по пятибальной, давайте скажу, что Grok 3 показали на двойку, Gemini 2.0 Pro на тройку с минусом, GPT-4.5 на тройку с плюсом. Может, это потому, что в модели ничего нет? Да нет же, вот буквально первый попавшийся мне в ленте блогпост от компании box.ai — они замерили качество в своем внутреннем бенчмарке на 510 юридических документов извлечение более чем 20'000 сущностей. Модель справилась на 19% лучше, чем 4o, а в отдельных категориях приросты были ещё больше (см. картинку). Правда, на отдельной подвыборке более сложных документов (200+ страниц, есть картинки) модель не во всём лучше 4o, в одной категории даже сильно проиграла (~25%, но там количество документов маленькое, наверное, и это условно может быть разница в 2-3 документа) — это на картинке #2. Готов спорить, что если бы датасет перевели на какой-то другой язык, да в идеале как можно более редкий, то качественный скачок был бы ещё заметнее. В профильном чате и даже у меня в комментариях, например, отметились люди, говорящие на армянском — и они отметили улучшения в общении/переводе у GPT-4.5. Но.. OpenAI этого не сделали! Они точно могли сказать, мол, «мы запартнерились с компанией Х, посчитали метрики У, и прирост вау» — и такое сделать с 3-5 компаниями. Причём, я не сомневаюсь, что такие кейсы реально можно будет найти, главная загадка почему они этого не сделали. Спешка? Хз, модель была обучена в сентябре, то есть в декабре-январе точно могли делать первые тесты. OpenAI говорят (а некоторые сотрудники пишут), что модель улучшилась в тех местах, на которые сложно указать пальцем (в значении «точно идентифицировать»), и что они ждут, что скажут пользователи. Всё же 4.5 пока имеет статус preview, и быть может через месяца полтора-два выйдет полноценный релиз, где соберут успешные кейсы как бизнесов и институтов, так и обычных пользователей, и там что-то покажут. А может и нет ¯\_(ツ)_/¯ А ещё, конечно, ждём Эло-рейтинг на LMSYS Arena, модель уже появилась в чатах, в первой половине следующей недели узнаем результат. (Моя ставка что топ-1 по всем категориям, но в некоторых будет делить место с reasoning-моделями: математика, программирование) P.S.: ну и да, с ТАКООООЙ ценой конечно модели может быть очень сложно пролезть в реальные юзкейсы; но оптимизация точно наступит.