Любопытное про изменение законов скейлинга для looped моделей. Завтра ещё одну статью про это бахну. How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents __Zixi Chen, Akshay Vegesna, Samip Dahal, Andrew Gordon Wilson__ Статья: https://arxiv.org/abs/2609.19107 Ревью: https://arxiviq.substack.com/p/how-model-growth-recursion-and-boundary Код: https://github.com/qlabs-eng/scaling-exponents ЧТО сделали: Исследовали, способны ли архитектурные изменения менять показатель степени в законах скейлинга предобучения, а не только константу. В pre-norm трансформерах изолировали граничную нормализацию, рекуррентные циклы и поэтапный рост глубины. Для каждого семейства авторы подобрали индивидуальные оптимальные по вычислениям режимы обучения. ЧТО получили: Архитектурные модификации действительно меняют показатель степени γ. У базового трансформера γ = 0.111. Добавление граничного оператора увеличивает показатель до γ = 0.114 (множитель вычислений 1.25x при 10^20 FLOPs — метрика, показывающая, во сколько раз больше вычислительного бюджета потребовалось бы стандартному бейзлайну, чтобы достичь точно такого же валидационного лосса, какой демонстрирует исследуемая модель), рост со связанными весами даёт γ = 0.116 (1.36x), а с независимыми весами — γ = 0.117 (1.55x). При экстраполяции до 1.23x10^21 FLOPs модель на 7.4B с независимым ростом показала точность 0.3865 на бенчмарке DCLM CORE из 22 задач, догнав GPT-3 13B с затратами вычислений примерно в 20 раз меньше. ПОЧЕМУ это важно: Прирост эффективности предобучения масштабируется вместе с объёмом вычислений, а не остаётся фиксированным сдвигом. Однако рост модели с независимыми весами требует динамического выделения памяти прямо посреди обучения. Двигать экспоненты тут: https://t.me/gonzo_ML_podcasts/4825
Любопытное про изменение законов скейлинга для looped моделей. Завтра ещё одну…
Из этого канала
- #6092Что если дать модели возможность переписывать контекст? Так чтобы она работала…
Что если дать модели возможность переписывать контекст? Так чтобы она работала с ним как с файлом? Простая и гениальная идея, не понимаю, почему её раньше…
- #6089Прикольный результат. Не все чекпойнты одинаково полезны. Очередная лотерея.…
Прикольный результат. Не все чекпойнты одинаково полезны. Очередная лотерея. Generalization Dynamics of LM Pre-Training Jiaxin Wen, Zhengxuan Wu, Dawn Song,…
- #6086Декомпозиция RSI :) The Last AI Built by Humans: Toward Genuine Recursive…
Декомпозиция RSI :) The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement Yi Duan, Ying Liu, Zirui Tang, Haodong Chen, Jun Zhou, Yumou Liu,…