Продолжая тему прироста метрик от дообучения рассуждениям (и другим сопутствующим улучшениям, уложенным всего в 2 месяца развития) — Gemini 2.5 Pro уверенно заняла первую строчку по средним результатам самых свежих математических соревнований (февраль '25-го и позже). В AIME метрики скорее всего как у o3 (к которой у нас нет доступа), раз уж mini-версия подбирается вплотную, а вот на HMMT зазор относительно модели OpenAI очень солидный. На второй картинке замер на оффлайн-части IQ-теста от Mensa. Невесть какой тест, конечно, но и там модель впереди планеты всей. (источник) Ризонер поверх большой базовой модели — тема 👆
Продолжая тему прироста метрик от дообучения рассуждениям (и другим…
Из этого канала
- #2477Я год назад очень рекомендовал курс по интерпретируемости, который входит в…
Я год назад очень рекомендовал курс по интерпретируемости, который входит в программу (и сопровождает один из треков).
- #2478"Открыт сбор заявок на программу по AI alignment ""MATS summer 2025"" Программа…
"Открыт сбор заявок на программу по AI alignment ""MATS summer 2025"" Программа MATS — это посеместровая, 10-недельная программа стипендий по исследованию…
- #2479Пачка непервоапрельских новостей с утра: — OpenAI официально закрыли раунд…
Пачка непервоапрельских новостей с утра: — OpenAI официально закрыли раунд инвестиций, договорившись о привлечении $40 миллиардов долларов при оценке в $300B.
- #2472Прошло больше полугода с поста про Deadlock, наверняка есть новые…
Прошло больше полугода с поста про Deadlock, наверняка есть новые интересующиеся — пост для вас.
- #2471Количество поисковых запросов по ChatGPT, анализируемых Google Trends,…
Количество поисковых запросов по ChatGPT, анализируемых Google Trends, чуть-чуть сравнялся и даже превысил оный у Google — настолько много желающих попробовать…