Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See the Basis, but Adam Does __Devender Singh__ Paper: https://arxiv.org/abs/2608.05136 Code: https://github.com/idevender/loss-basis-adam Review: https://arxiviq.substack.com/p/the-loss-does-not-see-the-basis-but ЧТО сделали: В работе представлена теоретическая и эмпирическая база для классификации оптимизаторов на основе калибровочной эквивариантности (gauge equivariance) относительно ортогональных преобразований в факторизованных моделях (W = UV^T). Автор доказывает теорему о структуре, характеризующую эквивариантные обновления без памяти как левые предусловители, определяемые матрицей Грама. Также доказана теорема переноса, связывающая потоки со скалярным предусловием с рескейленным градиентным спуском, и продемонстрировано, что зависящие от базиса оптимизаторы вроде Adam разрушают низкоранговую неявную регуляризацию, тогда как калибровочно-эквивариантные оптимизаторы (Gradient Descent, Muon, Shampoo) сохраняют её. ПОЧЕМУ это важно: Годами ML-сообщество оценивало оптимизаторы преимущественно по скорости сходимости и эффективности снижения функции потерь. Эта работа доказывает, что выбор оптимизатора фундаментально определяет, какое именно интерполирующее решение найдёт сеть. Покоординатная адаптивность разрушает внутренние вращательные симметрии, что приводит к серьёзным последствиям для обобщающей способности и слияния моделей (model merging, включая техники permutation и rotational re-basin) в современных архитектурах вроде трансформеров. Для практиков: Когда у моделей глубокого обучения есть избыточная факторизация параметров — например, матричные разложения или головы внимания в трансформерах — существует бесконечно много внутренних координатных базисов, которые дают абсолютно одинаковую функцию и лосс на обучении. Однако популярные оптимизаторы вроде Adam относятся к отдельным координатным осям по-разному. В результате Adam выбирает решения с более высоким рангом и худшей обобщающей способностью в зависимости от случайного начального поворота. В то же время оптимизаторы вроде Gradient Descent или Muon относятся ко всем направлениям симметрично и естественным образом находят простые низкоранговые решения. Инженерам важно понимать: выбор оптимизатора меняет то, чему учится модель, а не только то, как быстро она обучается. Искать симметрии тут: https://t.me/gonzo_ML_podcasts/4796
Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See…
Из этого канала
- #5950Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много…
Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много писали про динамические вычисления, когда слои вычисляются в разном порядке, с…
- #5942Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они…
Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они регулярно берут какую-то из базовых Gemma и делают из неё то полноценный…
- #5935Соскучились по новым законам скейлинга? Их есть у меня! Для более критического…
Соскучились по новым законам скейлинга? Их есть у меня! Для более критического восприятия добавил прожарку.