Первые независимые бенчмарки подъехали. Маленький шаг от Соннета, но огромный шаг от GPT-4o. Думаю, часть отставания от других моделей обусловлена knowledge cutoff (GPT-4.5 всё ещё знакома с миром до Октября 2023-го), часть — тем, что промпты для неё могут чуть иначе работать, но всё равно ниже ожиданий. Хотя если модель прям точно не учили на рассуждениях от других моделей (мы этого навеняка никогда не узнаем), то в среднем лишь совсем немного хуже ожиданий.
Первые независимые бенчмарки подъехали. Маленький шаг от Соннета, но огромный…
Из этого канала
- #2383"Наконец-то выдали доступ к 4.5 в ChatGPT. Кидайте под этот пост промпты и…
"Наконец-то выдали доступ к 4.5 в ChatGPT. Кидайте под этот пост промпты и задачи, завтра буду отбирать, тестировать и скидывать вам ответы на оценку.
- #2385"По традиции, выход новой модельки тестирую на копипасте про батин суп. На этот…
"По традиции, выход новой модельки тестирую на копипасте про батин суп. На этот раз стих от GPT 4.5 (Preview).
- #2386Немного подвожу итоги вчерашней презентации. Кажется, сами OpenAI не восприняли…
Немного подвожу итоги вчерашней презентации. Кажется, сами OpenAI не восприняли её супер-серьёзно: — никаких C-levels или VP (типа моего любимца Mark Chen) на…
- #2381Про точность знаний и галлюцинации: странно, что в статье этого нет, а на сайте…
Про точность знаний и галлюцинации: странно, что в статье этого нет, а на сайте модели есть, замеры на бенчмарке от самих же OpenAI SimpleQA.
- #2380Пост с выжимкой трансляции: — модель будет в API вместе с выпуском в…
Пост с выжимкой трансляции: — модель будет в API вместе с выпуском в Pro-подписку (сегодня) — Модель будет доступна разработчикам в API ВСЕХ ТИРОВ (не только…