Соскучились по новым законам скейлинга? Их есть у меня! Для более критического восприятия добавил прожарку. Полезно? Skaling: Chinchilla’s Exponents Meet Kaplan’s Coupling __Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja__ Paper: https://arxiv.org/abs/2608.07222 Code: https://github.com/facebookresearch/lingua # TL;DR ЧТО сделали: Авторы представляют закон Skaling — обобщённую математическую формулу скейлинга нейросетей, которая связывает размер модели N и объём данных D через единый внешний показатель взаимодействия k. В дополнение к математической формуле в работе предлагается стратегия редкой профилирующей сетки в форме буквы «L» («L-shape grid»), которая ограничивает пробные запуски предобучения узкими границами с низким расходом вычислительных ресурсов. ПОЧЕМУ это важно: Стандартные аддитивные законы скейлинга, включая широко используемый закон Шиншиллы (Chinchilla law), предполагают, что размер модели и объём данных влияют на лосс независимо, искусственно обнуляя их смешанную частную производную. Из-за этого математического изъяна возникают систематические ошибки прогнозирования в крайних режимах (при острой нехватке данных или сильном переобучении). Skaling устраняет эти краевые смещения, снижая среднюю абсолютную ошибку в процентах (MAPE) экстраполяции в 1.5-3 раза и одновременно сокращая вычисления на эмпирические эксперименты примерно в 10 раз. Для практиков: Распределение многомиллионных бюджетов на обучение передовых LLM опирается на прогнозирование итогового качества модели по небольшим пилотным запускам. Традиционные формулы скейлинга делают ошибочное допущение: рост размера модели и увеличение объёма данных действуют на снижение лосса абсолютно независимо. Введение всего одного параметра взаимодействия в законе Skaling убирает ошибки на границах. При этом, поскольку связанная поверхность лосса зафиксирована по своим краям, разработчики могут точно предсказывать результаты крупномасштабного обучения с помощью серии мелких экспериментов, выстроенных вдоль L-образной сетки, снижая накладные расходы на эксперименты на порядок. Разбор тут: https://t.me/gonzo_ML_podcasts/4792 Прожарка тут: https://t.me/gonzo_ML_podcasts/4793
Соскучились по новым законам скейлинга? Их есть у меня! Для более критического…
Из этого канала
- #5942Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они…
Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они регулярно берут какую-то из базовых Gemma и делают из неё то полноценный…
- #5950Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много…
Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много писали про динамические вычисления, когда слои вычисляются в разном порядке, с…
- #5956Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See…
Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See the Basis, but Adam Does Devender Singh Paper: https://arxiv.org/abs/2608.05136…
- #5931Прикольная работа про экономию памяти для работы с длинными…
Прикольная работа про экономию памяти для работы с длинными последовательностями. Использует то же наблюдение, что и недавняя работа про новый BERT — семантика…
- #5926По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with…
По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with Compute Flexibility Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang,…