Gemini 2.5 Pro обновилась, по показываемым бенчмаркам самый большой прирост произошёл в веб-программировании (см. вторую картинку). Google +уважение за то, что не побоялись сравниться с o3 (по многим бенчам проигрывает, см. первую картинку). Очень интересно, что оценка на SimpleQA — бенчмарке на знание очень редких и специфичных фактов — примерно одинаковая. Возможно это говорит о приблизительно равном размере моделей, но это (очень) неточно. На арене две версии Gemini и одна o3 делят первое место. По моим ощущениям, я почти всегда закидываю запрос и в o3, и в 2.5, обе почти всегда одинаково решают проблемы — но стиль написания Python-кода o3 мне ближе (не засоряет всё комментариями). За прошлую неделю было 2 раза, что o3 не решила, а 2.5 решила, и один раз наоборот. This is a good model sir. А ещё ждём preview Computer Use-версии (агент, контролирующий компьютер/браузер), который засветился на сайте. Будет ли он выпущен до Google I/O 20-21-го мая или же нам придётся ждать — не ясно. UPD: в комментах сравнили метрики с прошлой версией Gemini — они просели 😥 ``` HLE: 18.8 -> 17.8 🔴 GPQA: 84.0 -> 83.0 🔴 AIME: 86.7 -> 83.0 🔴 LiveCodeBench: 70.4 -> 75.6 🟢 Aider: 74.0/68.6 -> 76.5/72.7 🟢 SWE-Verified: 63.8 -> 63.2 🔴 SimpleQA: 52.9 -> 50.8 🔴 MMMU: 81.7 -> 79.6 🔴 ``` Возможно, уж слишком перетюнили модель под веб-разработку / просто кодинг / или даже арену. Плохая новость в том что новая модель заменяет старую, а не дополняет — они просто под капотом её заменили, и к старой не получится делать запросы.