Первые независимые бенчмарки подъехали. Маленький шаг от Соннета, но огромный шаг от GPT-4o. Думаю, часть отставания от других моделей обусловлена knowledge cutoff (GPT-4.5 всё ещё знакома с миром до Октября 2023-го), часть — тем, что промпты для неё могут чуть иначе работать, но всё равно ниже ожиданий. Хотя если модель прям точно не учили на рассуждениях от других моделей (мы этого навеняка никогда не узнаем), то в среднем лишь совсем немного хуже ожиданий.