Cognitive Behaviors that Enable Self-Improving Reasoners Когда вышла o1 от OpenAI, то хоть технических деталей и было мало, но сотрудники, включая Noam Brown, говорили, что там всё просто. Когда вышла R1 от DeepSeek, то это подтвердилось: просто (нифига не просто) берёшь модель, набор пар «задача — ответ», и запускаешь процедуру генерации сотен-тысяч цепочек рассуждений, награждая модель за те из них, которые приводят к правильным ответам. Работает это за счёт того, что модель нет-нет, да иногда и выдаст что-то правильное. Те рассуждения, которые привели к этому «правильно» закрепляются, усиляются (из-за метод и называется Reinforcement Learning). По сути вся тренировка сводится к тому, чтобы найти те наборы фраз, которые у модели ассоциируются с определёнными паттернами, и заставляют её им следовать. В воздухе витал вопрос — идея достаточно очевидная, почему до этого её никто не пробовал? Или почему ни у кого не получалось? (спойлер: люди много раз пробовали такое же или нечто очень схожее) Сегодняшняя статья пытается копнуть в эту тему и сравнить обучение двух разных базовых моделей одинакового размера, Qwen-2.5-3B и LLAMA-3B, рассуждениям для решения математической игры Countdown. Эта игра, в которой участнику даются 3 или 4 цифры, а также целевой результат, а он должен расставить скобки и знаки +, −, ×, ÷. Например, если вам говорят «25, 30, 3, 4» и «32», то ответ может выглядеть так: (30 − 25 + 3) × 4. Задача хороша тем, что в ней можно применять паттерны рассуждений (прямо как в сложных серьёзных задачах олимпиадного уровня) — и их авторы выделяют 4 штуки: — (1) Возврат назад или пересмотр подходов при обнаружении ошибок (например, если модель пишет «Этот подход не сработает, потому что...») — (2) Перепроверка промежуточных и финальных результатов («Давайте проверим этот результат с помощью...») — (3) Постановка подцелей, когда сложная проблема разбивается на меньшие шаги («Чтобы решить это, нам сначала нужно...») — (4) Рассуждение от обратного, когда решение строится в обратном направлении от желаемого результата («Чтобы достичь цели 32, нам нужно число, делящееся на...») Значит, авторы берут две модели, запускают на них тренировку почти как у o1/R1, только с задачами по типу Countdown, и сохраняют промежуточные модели по ходу обучения. За 250 шагов Qwen доходит до 60% правильных ответов, а LLAMA до 30% — очень большая разница.
Cognitive Behaviors that Enable Self-Improving Reasoners Когда вышла o1 от…
Из этого канала
- #2408Затем авторы берут все промежуточные модели и генерируют решения ими. Все…
Затем авторы берут все промежуточные модели и генерируют решения ими. Все решения пропускаются через GPT-4o-mini, которой в промпте дали задачу…
- #2410И ещё провели пару экспериментов с предварительным дообучением LLAMA 3B на…
И ещё провели пару экспериментов с предварительным дообучением LLAMA 3B на данных, содержащих примеры всех 4 паттернов рассуждений, чтобы показать, что если…
- #2411OpenAI представили на стриме 3 новых инструмента для разработчиков (остальным…
OpenAI представили на стриме 3 новых инструмента для разработчиков (остальным не особо интересно): — WebSearch Tool (то же, что у ChatGPT под капотом,…
- #2405R1 is not on par with o1, and the difference is qualitative, not quantitative…
R1 is not on par with o1, and the difference is qualitative, not quantitative Почти сразу после выхода DeepSeek R1 я писал, что не думаю, что модель на уровне…
- #2404Проклятье Starship V2. Прототип S34 снова был потерян за 20 секунд до выхода на…
Проклятье Starship V2. Прототип S34 снова был потерян за 20 секунд до выхода на орбиту. Есть фундаментальная проблема с конструкцией этого блока кораблей.