Продолжая тему прироста метрик от дообучения рассуждениям (и другим сопутствующим улучшениям, уложенным всего в 2 месяца развития) — Gemini 2.5 Pro уверенно заняла первую строчку по средним результатам самых свежих математических соревнований (февраль '25-го и позже). В AIME метрики скорее всего как у o3 (к которой у нас нет доступа), раз уж mini-версия подбирается вплотную, а вот на HMMT зазор относительно модели OpenAI очень солидный. На второй картинке замер на оффлайн-части IQ-теста от Mensa. Невесть какой тест, конечно, но и там модель впереди планеты всей. (источник) Ризонер поверх большой базовой модели — тема 👆