Затем авторы берут все промежуточные модели и генерируют решения ими. Все решения пропускаются через GPT-4o-mini, которой в промпте дали задачу классифицировать рассуждения по четырём указанным выше паттернам (и ещё примеров насыпали). Модель выдаёт предсказания для каждой цепочки рассуждений, и те агрегируются, чтобы считать, как часто то или иное поведение проявляется по ходу тренировки каждой из Small Language Models (крохи, по 3 миллиарда параметров). И вот тут-то и обнаруживается разница — у Qwen при переходе от 20 к 30 шагам обучения что-то щёлкает, и эти паттерны начинают проявляться очень часто. Вернее, только 2 паттерна — верификация (перепроверка результатов) и пересмотр подходов при обнаружении ошибок (backtraking). У LLAMA же по ходу всей тренировки почти по нулям, только маленький горбик в самом начале есть. А так как паттерны рассуждений не проявляются, то правильные ответы появляются реже -> обучение хуже. И сами паттерны не закрепляются. Значит, в самих моделях с самого начала есть разница. Поэтому взяли их, сгенерировали решения, снова классифицировали — и у Qwen даже без всякого дообучения под игру уже в 62% цепочек рассуждений есть само-проверка (против 10% у LLAMA-3B). (правда эти цифры не бьются с первым графиком, где считали частоту встречания паттернов, но я не понял почему). Ещё взяли LLAMA побольше, на 70B, и она чаще сама по себе применяет паттерны рассуждений, чем маленькая модель, но всё ещё реже, чем Qwen-3B. Это говорит о двух вещах: 1) Qwen почти наверняка этому отдельно учили 2) поскольку обучение с подкреплением может лишь усиливать поведение, проявляющееся в успешных траекториях, — делая присутствие этих паттернов предпосылкой для эффективного обучения — чем качественнее модель, тем лучше будет результат. (Тут вспоминаем, что GPT-4.5 сама по себе иногда обходит некоторые рассуждающие модели, и знает/читала кучу всего, и скорее всего тренировалась на синтетических цепочках рассуждений)
Затем авторы берут все промежуточные модели и генерируют решения ими. Все…
Из этого канала
- #2410И ещё провели пару экспериментов с предварительным дообучением LLAMA 3B на…
И ещё провели пару экспериментов с предварительным дообучением LLAMA 3B на данных, содержащих примеры всех 4 паттернов рассуждений, чтобы показать, что если…
- #2411OpenAI представили на стриме 3 новых инструмента для разработчиков (остальным…
OpenAI представили на стриме 3 новых инструмента для разработчиков (остальным не особо интересно): — WebSearch Tool (то же, что у ChatGPT под капотом,…
- #2413The AI Scientist Generates its First Peer-Reviewed Scientific Publication Я…
The AI Scientist Generates its First Peer-Reviewed Scientific Publication Я писал про пару работ Sakana.AI, но не писал про одну из самых интересных — про AI…
- #2407Cognitive Behaviors that Enable Self-Improving Reasoners Когда вышла o1 от…
Cognitive Behaviors that Enable Self-Improving Reasoners Когда вышла o1 от OpenAI, то хоть технических деталей и было мало, но сотрудники, включая Noam Brown,…
- #2405R1 is not on par with o1, and the difference is qualitative, not quantitative…
R1 is not on par with o1, and the difference is qualitative, not quantitative Почти сразу после выхода DeepSeek R1 я писал, что не думаю, что модель на уровне…