Соскучились по новым законам скейлинга? Их есть у меня! Для более критического восприятия добавил прожарку. Полезно? Skaling: Chinchilla’s Exponents Meet Kaplan’s Coupling __Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja__ Paper: https://arxiv.org/abs/2608.07222 Code: https://github.com/facebookresearch/lingua # TL;DR ЧТО сделали: Авторы представляют закон Skaling — обобщённую математическую формулу скейлинга нейросетей, которая связывает размер модели N и объём данных D через единый внешний показатель взаимодействия k. В дополнение к математической формуле в работе предлагается стратегия редкой профилирующей сетки в форме буквы «L» («L-shape grid»), которая ограничивает пробные запуски предобучения узкими границами с низким расходом вычислительных ресурсов. ПОЧЕМУ это важно: Стандартные аддитивные законы скейлинга, включая широко используемый закон Шиншиллы (Chinchilla law), предполагают, что размер модели и объём данных влияют на лосс независимо, искусственно обнуляя их смешанную частную производную. Из-за этого математического изъяна возникают систематические ошибки прогнозирования в крайних режимах (при острой нехватке данных или сильном переобучении). Skaling устраняет эти краевые смещения, снижая среднюю абсолютную ошибку в процентах (MAPE) экстраполяции в 1.5-3 раза и одновременно сокращая вычисления на эмпирические эксперименты примерно в 10 раз. Для практиков: Распределение многомиллионных бюджетов на обучение передовых LLM опирается на прогнозирование итогового качества модели по небольшим пилотным запускам. Традиционные формулы скейлинга делают ошибочное допущение: рост размера модели и увеличение объёма данных действуют на снижение лосса абсолютно независимо. Введение всего одного параметра взаимодействия в законе Skaling убирает ошибки на границах. При этом, поскольку связанная поверхность лосса зафиксирована по своим краям, разработчики могут точно предсказывать результаты крупномасштабного обучения с помощью серии мелких экспериментов, выстроенных вдоль L-образной сетки, снижая накладные расходы на эксперименты на порядок. Разбор тут: https://t.me/gonzo_ML_podcasts/4792 Прожарка тут: https://t.me/gonzo_ML_podcasts/4793