Reinforcement Learning is all You Need Обязательным пререквизитом будет прочтение вот этого (и 2 следующих) постов про тренировку LLM рассуждениям через игру Countdown. В конце разбора я написал, мол, жаль, что не попробовали научить на игре, а потом замерить прирост качества на математических задачах. Это помогло бы показать positive transfer, когда навыки рассуждений, выученные на простых математических играх, помогают решать более сложные и непохожие задачи. Сегодня у нас даже не статья, а скорее мини-отчёт о проделанных экспериментах (там даже автор — один). Сделали ровно то, чего мне хотелось: 1) обучили маленькую модель Qwen-2.5-Instruct 3B рассуждать на Countdown 2) замерили приросты на 5 бенчмарках На первой картинке вы можете видеть приросты (или их отсутствие) по сравнению с базовой моделью (не дообученной «рассуждать» на игре Countdown) и с той же самой моделью, но запромпченной рассуждать и использовать теги <think> и <answer> (потому что именно такой промпт используется после обучения игре, и по-хорошему нужно понять, что прирост не от него). На второй — приросты в отдельных категориях на BigBenchHard (стаарый бенчмарк, который уже почти не используют, но для 3B модельки и рассуждений кмк всё ещё подходит). Я выделил самые большие изменения, и они как раз в тех категориях, где рассуждения ожидаемо приносят приросты. И ещё раз: эти приросты получены не обучением на эти задачи, а на обучении рассуждать для победы в игре на счёт. В отчёте есть ещё интересный мини-анализ того, как у модели проходит «Aha moment», когда в рассуждениях получаются фразы «Погодите, на самом деле...» (когда модель заметила ошибку в подходе). В общем, позитив в том, что тренировка даже на игрушечных проблемах способствует прокачке рассуждений, применимых в других областях — хоть и не всех.
Reinforcement Learning is all You Need Обязательным пререквизитом будет…
Из этого канала
- #2428Суд отклонил последнюю попытку Илона замедлить OpenAI Перевод выборочных…
Суд отклонил последнюю попытку Илона замедлить OpenAI Перевод выборочных частей: На прошлой неделе суд отклонил ходатайство Elon Musk о предварительном запрете…
- #2431Из документа OpenAI для Управления по технологиям и науке, часть касательно…
Из документа OpenAI для Управления по технологиям и науке, часть касательно копирайта: Применение доктрины добросовестного использования [данных] к ИИ — это не…
- #2433Ещё несколько интересных примеров из интернетов (почти всё взял из этого…
Ещё несколько интересных примеров из интернетов (почти всё взял из этого треда), где показываются разные способы применения нативной генерации изображений.
- #2425Начинаем через 15 минут
Начинаем через 15 минут
- #2424Сегодня ровно 2 года с момента анонса и выхода GPT-4, и в честь этого мы с…
Сегодня ровно 2 года с момента анонса и выхода GPT-4, и в честь этого мы с @cryptovalerii сделаем стрим.