Про точность знаний и галлюцинации: странно, что в статье этого нет, а на сайте модели есть, замеры на бенчмарке от самих же OpenAI SimpleQA. Точность ответов модели выросла существенно (тут намеренно отобраны вопросы, на которых модели прошлого поколения ошибались). GPT-4.5 выдаёт 62.5% правильных ответов, а, например, Gemini 2.0 Pro от Google 44.3%. Огромная разница. Галлюцинации более редки, чем у рассуждающей o1 (правая картинка). Ещё раз напишу, что рассуждалка поверх 4.5 будет ОООЧЕНЬ клёвой ~~и дорогой~~.
Про точность знаний и галлюцинации: странно, что в статье этого нет, а на сайте…
Из этого канала
- #2382Первые независимые бенчмарки подъехали. Маленький шаг от Соннета, но огромный…
Первые независимые бенчмарки подъехали. Маленький шаг от Соннета, но огромный шаг от GPT-4o.
- #2383"Наконец-то выдали доступ к 4.5 в ChatGPT. Кидайте под этот пост промпты и…
"Наконец-то выдали доступ к 4.5 в ChatGPT. Кидайте под этот пост промпты и задачи, завтра буду отбирать, тестировать и скидывать вам ответы на оценку.
- #2385"По традиции, выход новой модельки тестирую на копипасте про батин суп. На этот…
"По традиции, выход новой модельки тестирую на копипасте про батин суп. На этот раз стих от GPT 4.5 (Preview).
- #2380Пост с выжимкой трансляции: — модель будет в API вместе с выпуском в…
Пост с выжимкой трансляции: — модель будет в API вместе с выпуском в Pro-подписку (сегодня) — Модель будет доступна разработчикам в API ВСЕХ ТИРОВ (не только…
- #2379"ООООЧень краткое объяснение того, почему ризонеры так сильно прокачивают…
"ООООЧень краткое объяснение того, почему ризонеры так сильно прокачивают модели, и почему они выигрывают «модели следующего поколения», обученные на в…