Cognitive Behaviors that Enable Self-Improving Reasoners Когда вышла o1 от OpenAI, то хоть технических деталей и было мало, но сотрудники, включая Noam Brown, говорили, что там всё просто. Когда вышла R1 от DeepSeek, то это подтвердилось: просто (нифига не просто) берёшь модель, набор пар «задача — ответ», и запускаешь процедуру генерации сотен-тысяч цепочек рассуждений, награждая модель за те из них, которые приводят к правильным ответам. Работает это за счёт того, что модель нет-нет, да иногда и выдаст что-то правильное. Те рассуждения, которые привели к этому «правильно» закрепляются, усиляются (из-за метод и называется Reinforcement Learning). По сути вся тренировка сводится к тому, чтобы найти те наборы фраз, которые у модели ассоциируются с определёнными паттернами, и заставляют её им следовать. В воздухе витал вопрос — идея достаточно очевидная, почему до этого её никто не пробовал? Или почему ни у кого не получалось? (спойлер: люди много раз пробовали такое же или нечто очень схожее) Сегодняшняя статья пытается копнуть в эту тему и сравнить обучение двух разных базовых моделей одинакового размера, Qwen-2.5-3B и LLAMA-3B, рассуждениям для решения математической игры Countdown. Эта игра, в которой участнику даются 3 или 4 цифры, а также целевой результат, а он должен расставить скобки и знаки +, −, ×, ÷. Например, если вам говорят «25, 30, 3, 4» и «32», то ответ может выглядеть так: (30 − 25 + 3) × 4. Задача хороша тем, что в ней можно применять паттерны рассуждений (прямо как в сложных серьёзных задачах олимпиадного уровня) — и их авторы выделяют 4 штуки: — (1) Возврат назад или пересмотр подходов при обнаружении ошибок (например, если модель пишет «Этот подход не сработает, потому что...») — (2) Перепроверка промежуточных и финальных результатов («Давайте проверим этот результат с помощью...») — (3) Постановка подцелей, когда сложная проблема разбивается на меньшие шаги («Чтобы решить это, нам сначала нужно...») — (4) Рассуждение от обратного, когда решение строится в обратном направлении от желаемого результата («Чтобы достичь цели 32, нам нужно число, делящееся на...») Значит, авторы берут две модели, запускают на них тренировку почти как у o1/R1, только с задачами по типу Countdown, и сохраняют промежуточные модели по ходу обучения. За 250 шагов Qwen доходит до 60% правильных ответов, а LLAMA до 30% — очень большая разница.