Дистилляция в байтовые модели открывает новые законы скейлинга. Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models __Kalyani Marathe, Artidoro Pagnoni, Tomasz Limisiewicz, Margaret Li, Mike Lewis, Luke Zettlemoyer, Srinivasan Iyer__ Paper: https://arxiv.org/abs/2609.12303 Review: https://arxiviq.substack.com/p/breaking-the-token-ceiling-distilling Code: N/A Model: N/A ЧТО сделали: Авторы провели масштабное теоретическое и эмпирическое исследование овертрейнинга dense-трансформеров с архитектурой decoder-only на стыке двух осей: парадигмы токенизации (BPE-токены против сырых байтов UTF-8) и функции потерь (supervised cross-entropy против дистилляции знаний). Чтобы переносить знания от крупных моделей-учителей с BPE-словарями без вычислительно неподъёмных многопроходных авторегрессионных вычислений, исследователи разработали два метода однопроходной конвертации логитов: приближённую условную маргинализацию Marginalize-It и точный метод End-Of-Token, расширяющий байтовый словарь структурным разделителем конца токена <eot>. Обучив сетку 1B-моделей на объёме до 1 триллиона байт с учителем Llama 3-8B, авторы вывели степенные законы скейлинга, связывающие тренировочные FLOPs, валидационный лосс в битах на байт (BPB) и точность на восьми бенчмарках. ПОЧЕМУ это важно: Общепринятые подходы к токенизации опираются на эвристики вроде Byte Pair Encoding (BPE), которые создают узкие места в репрезентации данных, раздувают словарь, страдают от артефактов на границах слов и требуют колоссальных объёмов памяти для сохранения логитов при офлайн-дистилляции. Байтовые архитектуры традиционно уступали токенным при малых вычислительных бюджетах из-за удлинения последовательностей. Однако эта работа доказывает, что байтовые модели демонстрируют значительно более крутую траекторию скейлинга и заметно более высокий асимптотический потолок качества. Точно дистиллированные байтовые модели превосходят токенные аналоги по средней точности на задачах на величину до 4%, догоняют их по качеству всего на 1/6 объёма обучающих данных и сокращают затраты дискового пространства на хранение логитов учителя примерно в пять раз за счёт отказа от усечения top-k. Для практиков: Долгое время считалось, что учить языковые модели напрямую на сырых символах или байтах вычислительно неэффективно по сравнению с BPE-токенизацией. Данная работа опровергает этот тезис для режимов длительного обучения с большим бюджетом вычислений. При переносе знаний из 8B-учителя в компактные 1B-модели токенные ученики быстро упираются в плато, где дальнейшие вычисления дают околонулевой прирост. Байтовые модели стартуют медленнее, так как тратят ресурсы на сборку слов из байтов, но сохраняют устойчивый прогресс на длинной дистанции. Добавление простого разделителя <eot> позволяет переводить распределение учителя в байтовые последовательности за один проход, обеспечивая то же качество при экономии 84% обучающих данных и 80% места на диске под логиты. Если ваша цель — выжать максимум качества из компактной модели для инференса на устройствах при наличии мощностей для долгого обучения, дистилляция напрямую в байтовую архитектуру позволяет преодолеть фундаментальные ограничения стандартных токенизаторов. Дистиллировать в байты тут: https://t.me/gonzo_ML_podcasts/4805
Дистилляция в байтовые модели открывает новые законы скейлинга. Breaking the…
Из этого канала
- #6020Мемы про муху не прекращаются. Извинити.
Мемы про муху не прекращаются. Извинити.
- #6021В крупной айти компании работает программист. Рядом на мониторе постоянно…
В крупной айти компании работает программист. Рядом на мониторе постоянно запущен оцифрованный мозг мухи и наблюдает, как он пишет код.
- #6011Очень прикольная работа, продолжает другую работу этих же авторов, где проблема…
Очень прикольная работа, продолжает другую работу этих же авторов, где проблема отслеживания состояния внутри трансформеров (которое только уползает вверх и…
- #6006Про важность хороших бейзлайнов и качественную сантехнику. Sliding-Window Beats…
Про важность хороших бейзлайнов и качественную сантехнику. Sliding-Window Beats Linear Attention Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina…
- #6000В стане концептуальных моделей (самая известная, наверное, была LCM)…
В стане концептуальных моделей (самая известная, наверное, была LCM) пополнения, скейлим модели и делаем их более end-to-end.