Reinforcement Learning is all You Need Обязательным пререквизитом будет прочтение вот этого (и 2 следующих) постов про тренировку LLM рассуждениям через игру Countdown. В конце разбора я написал, мол, жаль, что не попробовали научить на игре, а потом замерить прирост качества на математических задачах. Это помогло бы показать positive transfer, когда навыки рассуждений, выученные на простых математических играх, помогают решать более сложные и непохожие задачи. Сегодня у нас даже не статья, а скорее мини-отчёт о проделанных экспериментах (там даже автор — один). Сделали ровно то, чего мне хотелось: 1) обучили маленькую модель Qwen-2.5-Instruct 3B рассуждать на Countdown 2) замерили приросты на 5 бенчмарках На первой картинке вы можете видеть приросты (или их отсутствие) по сравнению с базовой моделью (не дообученной «рассуждать» на игре Countdown) и с той же самой моделью, но запромпченной рассуждать и использовать теги <think> и <answer> (потому что именно такой промпт используется после обучения игре, и по-хорошему нужно понять, что прирост не от него). На второй — приросты в отдельных категориях на BigBenchHard (стаарый бенчмарк, который уже почти не используют, но для 3B модельки и рассуждений кмк всё ещё подходит). Я выделил самые большие изменения, и они как раз в тех категориях, где рассуждения ожидаемо приносят приросты. И ещё раз: эти приросты получены не обучением на эти задачи, а на обучении рассуждать для победы в игре на счёт. В отчёте есть ещё интересный мини-анализ того, как у модели проходит «Aha moment», когда в рассуждениях получаются фразы «Погодите, на самом деле...» (когда модель заметила ошибку в подходе). В общем, позитив в том, что тренировка даже на игрушечных проблемах способствует прокачке рассуждений, применимых в других областях — хоть и не всех.