Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See the Basis, but Adam Does __Devender Singh__ Paper: https://arxiv.org/abs/2608.05136 Code: https://github.com/idevender/loss-basis-adam Review: https://arxiviq.substack.com/p/the-loss-does-not-see-the-basis-but ЧТО сделали: В работе представлена теоретическая и эмпирическая база для классификации оптимизаторов на основе калибровочной эквивариантности (gauge equivariance) относительно ортогональных преобразований в факторизованных моделях (W = UV^T). Автор доказывает теорему о структуре, характеризующую эквивариантные обновления без памяти как левые предусловители, определяемые матрицей Грама. Также доказана теорема переноса, связывающая потоки со скалярным предусловием с рескейленным градиентным спуском, и продемонстрировано, что зависящие от базиса оптимизаторы вроде Adam разрушают низкоранговую неявную регуляризацию, тогда как калибровочно-эквивариантные оптимизаторы (Gradient Descent, Muon, Shampoo) сохраняют её. ПОЧЕМУ это важно: Годами ML-сообщество оценивало оптимизаторы преимущественно по скорости сходимости и эффективности снижения функции потерь. Эта работа доказывает, что выбор оптимизатора фундаментально определяет, какое именно интерполирующее решение найдёт сеть. Покоординатная адаптивность разрушает внутренние вращательные симметрии, что приводит к серьёзным последствиям для обобщающей способности и слияния моделей (model merging, включая техники permutation и rotational re-basin) в современных архитектурах вроде трансформеров. Для практиков: Когда у моделей глубокого обучения есть избыточная факторизация параметров — например, матричные разложения или головы внимания в трансформерах — существует бесконечно много внутренних координатных базисов, которые дают абсолютно одинаковую функцию и лосс на обучении. Однако популярные оптимизаторы вроде Adam относятся к отдельным координатным осям по-разному. В результате Adam выбирает решения с более высоким рангом и худшей обобщающей способностью в зависимости от случайного начального поворота. В то же время оптимизаторы вроде Gradient Descent или Muon относятся ко всем направлениям симметрично и естественным образом находят простые низкоранговые решения. Инженерам важно понимать: выбор оптимизатора меняет то, чему учится модель, а не только то, как быстро она обучается. Искать симметрии тут: https://t.me/gonzo_ML_podcasts/4796