Ещё свежая математическая статья про динамику оптимизации и важность факторизации матриц внимания. High-Dimensional Learning Dynamics of Attention-Indexed Models __Yizhou Xu, Margarita Sagitova, Lenka Zdeborová, and Florent Krzakala__ Paper: https://arxiv.org/abs/2609.03858 Review: https://arxiviq.substack.com/p/high-dimensional-learning-dynamics Code: N/A Model: N/A ЧТО сделали: Авторы построили макроскопическую теорию динамики обучения для моделей с механизмом внимания в пределе высокой размерности, где матрицы внимания обладают экстенсивным рангом, растущим прямо пропорционально размерности эмбеддингов d. В то время как асимптотический популяционный лосс полностью определяется компактным конечномерным набором следовых параметров порядка, онлайн-SGD индуцирует бесконечномерную иерархию зацепленных матричных моментов. Эту иерархию строго описывает система детерминированных ОДУ, а усечения конечного порядка аппроксимируют её с экспоненциальной точностью. Опираясь на полученный аппарат, авторы доказали, что параметризация внимания работает как архитектурный implicit bias: связывание весов (S = WW^T) запускает автоматическое нарушение симметрии и обеспечивает слабое восстановление учителя за Θ(d^2 log d) шагов по выборке, тогда как раздельное внимание (S = UV^T) демонстрирует двухмасштабную релаксацию, где успех восстановления всецело зависит от того, сможет ли быстрый дрейф средних разрушить неинформативную симметрию студента. ПОЧЕМУ это важно: Классический теоретический анализ механизмов внимания обычно скатывается в одно из двух упрощений: либо игнорирует термодинамический предел высокой размерности, либо искусственно ограничивает ранг матриц внимания константой Θ(1). В современных же моделях эффективный ранг растёт вместе с пространством представлений. Настоящая работа переносит методы математической физики на современные архитектуры трансформеров и доказывает: факторизация матриц внимания — это не просто удобная перепараметризация общего ландшафта функции потерь, а фундаментальная смена траекторий градиентного спуска. Она превращает узкие горлышки оптимизации в проходимые сценарии обучения признаков за счёт архитектурного нарушения симметрии. Для практиков: Теория долго не могла строго объяснить, как трансформеры на этапе предобучения выбираются из неинформативных начальных состояний, поскольку исследовала игрушечные низкоранговые матрицы. Если ранг реалистичен и растёт вместе с размерностью, статический ландшафт функции потерь выглядит просто, но реальная траектория оптимизатора бесконечномерна. Выбранный способ факторизации проекций выступает скрытым регуляризатором: связывание весов (S = WW^T) принуждает оптимизатор автоматически разрушать непродуктивные симметрии и быстро выучивать фичи, тогда как раздельные проекции (S = UV^T) расщепляют динамику на сверхбыстрое выравнивание средних и медленное обучение признаков, гарантированно срабатывающее лишь при удачной конфигурации пограничного слоя. Погружаться тут: https://t.me/gonzo_ML_podcasts/4815
Ещё свежая математическая статья про динамику оптимизации и важность…
Из этого канала
- #6052Снова про теорию генерализации и гроккинга. Много математики для желающих :) A…
Снова про теорию генерализации и гроккинга. Много математики для желающих :) A Theoretical Analysis of Generalization Dynamics in Neural Networks under…
- #6051Скажите вообще, насколько такой формат про Jev был полезен? Что хорошо, что…
Скажите вообще, насколько такой формат про Jev был полезен? Что хорошо, что плохо, что надо улучшить или сделать по-другому? Есть ещё какие-то темы, которые…
- #6050Вдогонку про Jev, вот чуваки начали собирать каталог применений и прочего:…
Вдогонку про Jev, вот чуваки начали собирать каталог применений и прочего: https://github.com/AnotiaWang/awesome-jev