Прошла AIME II, авторы снова замерили модели. Топ на __свежих задачах*__ не поменялся — o3-mini, o1, потом R1. Кажется, задачи в этот раз были легче: топ-1 решила все задачи как минимум по одному разу (из 4 попыток). Ризонер от Google снова потерялся в серединке( * Не могу найти ссылку, но по итогу для AIME I видел в твиттере, что нашли 9 таких же или очень похожих задач (из 15), опубликованных в интернете до олимпиады за значимый срок. Интересно, сколько найдут тут. Авторы matharena, проводившие оценку, опубликовали код для проверки, а также заявили, что следующие замеры проведут через 2 дня — там пройдет HMMT, мат. соревнование, проводимое в Harvard + MIT. Задачек там вроде побольше, и они кажется даже чуть посложнее (википедия говорит «mid-AIME to olympiad»). Желаем удачи LLM-контестантам 👀 UPD: интересно если на свежей олимпиаде 9 из 15 задач были в интернете в почти таком же виде, то что это говорит о более ранних датасетах для эвалюации, по которым мы сравнивали модели последние полгода 🤯😑