ПОСТ ПРО ДИПСИК (но не полный) Наконец-то состоялось первое серьезное мероприятие с олимпиадными задачами по математике в период после релиза рассуждающих моделей. Можно взять свежие проблемы, которых __не было в тренировочных__ __данных*__, пропустить через все интересные нам LLM и сравнить. Соревнование это — American Invitational Mathematics Examination (AIME), первая часть из двух, в каждой из которых по 15 задач. Вторая пятнашка появятся 12-го февраля, тоже отпишусь. На картинке вы видите, как разные модели справились с олимпиадой. Каждая модель решала каждую задачу 4 раза (независимо от других своих попыток). Зелёный квадратик означает, что модель справилась 4/4 раз, желтый 1-3, красный — 0 раз из 4. Кому не интересно вникать — проще смотреть колонку «Acc», где отображена усреднённая точность «участников». Модели OpenAI с большим отрывом обходят R1 (кстати топ-1 и стоит дешевле 😀), Sonnet 3.6 из коробки вообще ничего не решает. Но что куда интереснее это сравнить метрики за 2024й год (которые репортились самими компаниями) и то, что получилось в 2025м: — o3-mini: 87.3% -> 78.33% сейчас, есть просадка но всё равно топ-1 — o1: 74.4% -> 76.67%, показала себя даже чуть лучше, чем на давно доступных задачах — R1: 79.8% -> 65% 🥱☠️ — дистиллянт R1-Qwen-14b: 69.7% -> 50% (падение даже больше чем у R1) Я не думаю, что эти данные ультимативно подтверждают тезис о лучшей генерализации и отсутствии переобученности моделей OpenAI, но делают хорошую подводку. (это не отменяет того что модель R1 от DeepSeek хороша) * а вот в этом твиттер-треде нашли, что как минимум 3 задачи уже были в интернете (куда смотрели авторы олимпиады..?). Источник — MathArena, увидел у @j_links. Задачи читать тут.