Улучшение лоры подвезли. Normalized Low-Rank Adaptation __Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu__ Paper: https://arxiv.org/abs/2608.31036 Code: https://spherelab.ai/NoRA Review: https://arxiviq.substack.com/p/normalized-low-rank-adaptation # TL;DR ЧТО сделали: Исследователи обнаружили фундаментальную проблему оптимизации в классическом LoRA, вызванную неконтролируемым разбросом масштабов в матрице понижающей проекции (down-projection). Чтобы это исправить, авторы предложили Normalized Low-Rank Adaptation (NoRA) и её облегчённую версию NoRA-init. Подход фиксирует единичную евклидову норму столбцов матрицы понижающей проекции по размерности ранга. Это выравнивает масштаб градиентов с уровнем полного файнтюнинга и сохраняет возможность точного линейного слияния весов для инференса. ПОЧЕМУ это важно: Несмотря на повсеместное использование LoRA для файнтюнинга языковых моделей, на ранних шагах адаптер страдает от заниженных норм градиентов и сильного покоординатного дисбаланса эффективного learning rate. NoRA убирает этот затык без добавления параметров, без роста задержек на инференсе и без вычисления дорогостоящего SVD. В отличие от спектральных методов инициализации, NoRA демонстрирует стабильность во всех сценариях: от предобучения и SFT до обучения с подкреплением с проверяемыми наградами (RLVR). Для практиков: LoRA — главный рабочий инструмент для бюджетной адаптации моделей. Однако из-за того, что одна половина адаптера инициализируется нулями, а вторая — случайными числами, первые шаги обучения опираются на случайные проекции, искажающие скорость обновления параметров. Простая нормализация проекций на старте (NoRA-init) или поддержание их нормализованными во время обучения (NoRA) позволяет моделям учиться существенно быстрее и достигать более высокой точности в задачах на рассуждение, математику и код. При этом сохраняется главное достоинство LoRA: обученные веса можно безболезненно влить обратно в базовую модель без накладных расходов. Фиксить градиенты лоры здесь: https://t.me/gonzo_ML_podcasts/4799
Улучшение лоры подвезли. Normalized Low-Rank Adaptation Jiale Kang, Ziyin Yue,…
Из этого канала
- #5976"Наша читательница Аделаида Данилова, AI мехинтерп ресерчер из университета…
"Наша читательница Аделаида Данилова, AI мехинтерп ресерчер из университета Люксембурга, сделала краткий обзор своей свежей прикольной статьи.
- #5974Развитие старой доброй работы про креативность цифровой эволюции, которую мы…
Развитие старой доброй работы про креативность цифровой эволюции, которую мы однажды разбирали на нашем Gonzo AGI семинаре, когда он ещё был.
- #5968Михаила Белкина вам в ленту. MLP выучивает неявный MoE. Revenge of…
Михаила Белкина вам в ленту. MLP выучивает неявный MoE. Revenge of Monosemanticity: Specialized Neurons Improve Data Efficiency in MLPs Amirhesam Abedsoltan,…