Интересные находки про обучение малых LLM из предобученных больших. Small LLMs: Pruning vs. Training from Scratch __Yufeng Xu, Taiming Lu, Kunjun Li, Jiachen Zhu, Mingjie Sun, Zhuang Liu__ Paper: https://arxiv.org/abs/2606.14150v3 Review: https://arxiviq.substack.com/p/small-llms-pruning-vs-training-from Code: https://github.com/zlab-princeton/pruning-vs-scratch Model: https://ai.meta.com/blog/meta-llama-3-1 # TL;DR ЧТО сделали: Авторы провели строгое эмпирическое сравнение прунинга (удаления весов) и обучения с нуля для небольших языковых моделей (LLM) с выравниванием по количеству токенов. Оценив шесть методов прунинга на пяти уровнях детализации (по глубине, ширине, совместный по глубине и ширине, полуструктурированный 2:4 и неструктурированный), исследователи выделили ценность инициализации вырезанными весами в двух режимах: при равном бюджете токенов на дообучение и при равном суммарном бюджете токенов на весь пайплайн. ПОЧЕМУ это важно: Работа меняет взгляд на прунинг нейросетей: это не просто метод сжатия post-hoc, а скорее стратегия эффективной инициализации. Важнейший вывод: когда суммарные вычислительные ресурсы и бюджет токенов выравниваются для всего пайплайна, грубый структурированный прунинг работает в основном как поиск нейросетевых архитектур (NAS). Его результаты можно повторить или превзойти, просто обучив меньшую плотную (dense) архитектуру с нуля. Напротив, мелкозернистый (fine-grained) спарс-прунинг передаёт специфические знания на уровне отдельных весов, которые не удаётся восполнить просто добавлением токенов при обучении. Для практиков: Для руководителей R&D и инженеров статья даёт чёткое правило. Если у вас есть сильная предобученная родительская модель, а данные для дообучения строго ограничены, прунинг даст отличную фору по сравнению со случайной инициализацией. Однако если целевых данных предостаточно, а для деплоя требуется плотная архитектура, предобучать огромную модель только ради структурированного прунинга вычислительно невыгодно. В таком режиме разумнее потратить весь бюджет токенов на прямое обучение целевой небольшой плотной модели с нуля — вы получите аналогичное или даже лучшее качество. Коцать ллмки тут: https://t.me/gonzo_ML_podcasts/4676