Снова про теорию генерализации и гроккинга. Много математики для желающих :) A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay __Yuqing Wang, Ioannis G. Kevrekidis, Mikhail Belkin__ Paper: https://arxiv.org/abs/2609.07755 Review: https://arxiviq.substack.com/p/a-theoretical-analysis-of-generalization ЧТО сделали: Авторы построили строгий теоретический фреймворк для анализа динамики обобщения глубоких нейросетей при оптимизации градиентным спуском с weight decay на квадратичном лоссе. Разбив входное пространство на ячейки вокруг обучающих точек, исследователи разложили популяционный риск на три слагаемых: ошибку данных, ошибку оптимизации и ошибку вариации предсказаний. В предположениях диссипативности и локальной приближённой однородности доказано, что weight decay сжимает внутренние представления, гарантируя эмпирическую сходимость и задавая необходимые и достаточные условия для послойной сходимости и эффекта гроккинга (grokking). ПОЧЕМУ это важно: Классическая теория статистического обучения опирается на статические границы равномерной сходимости, которые бессильны перед перепараметризованными сетями, интерполирующими шум или демонстрирующими отложенное обобщение. Предложенный подход выходит далеко за рамки линеаризованного режима нейро-касательного ядра (NTK) и игрушечных постановок. Он объединяет геометрию данных, глубину сети и алгоритмическую регуляризацию в общую динамическую теорию, объясняя, почему глубокие слои обобщают позже и как weight decay управляет временным зазором между запоминанием и генерализацией. Для практиков: На практике глубокие сети часто ведут себя контринтуитивно: тренировочный лосс падает практически в ноль почти мгновенно, но тестовая точность выходит на плато и лишь спустя тысячи дополнительных шагов резко взлетает — это и есть гроккинг. Работа математически объясняет этот феномен: подгонка под обучающую выборку и генерализация управляются двумя разными физическими процессами, идущими на разных временных масштабах. Запоминание обучающих точек происходит быстро вдоль координат данных, тогда как для истинного обобщения требуется время, чтобы weight decay успел подавить неконтролируемые осцилляции функции во всём остальном объёме входного пространства. Описав, как это сжатие послойно распространяется по сети, теория даёт конкретные критерии баланса между покрытием датасета, силой weight decay и длительностью обучения. Подводить базу здесь: https://t.me/gonzo_ML_podcasts/4814
Снова про теорию генерализации и гроккинга. Много математики для желающих :) A…
Из этого канала
- #6051Скажите вообще, насколько такой формат про Jev был полезен? Что хорошо, что…
Скажите вообще, насколько такой формат про Jev был полезен? Что хорошо, что плохо, что надо улучшить или сделать по-другому? Есть ещё какие-то темы, которые…
- #6050Вдогонку про Jev, вот чуваки начали собирать каталог применений и прочего:…
Вдогонку про Jev, вот чуваки начали собирать каталог применений и прочего: https://github.com/AnotiaWang/awesome-jev
- #6047Про Darwin Gödel Machine писали, про Huxley-Gödel Machine писали, а про Red…
Про Darwin Gödel Machine писали, про Huxley-Gödel Machine писали, а про Red Queen Gödel Machine не писали! Исправляемся.