Интересные находки про обучение малых LLM из предобученных больших. Small LLMs: Pruning vs. Training from Scratch __Yufeng Xu, Taiming Lu, Kunjun Li, Jiachen Zhu, Mingjie Sun, Zhuang Liu__ Paper: https://arxiv.org/abs/2606.14150v3 Review: https://arxiviq.substack.com/p/small-llms-pruning-vs-training-from Code: https://github.com/zlab-princeton/pruning-vs-scratch Model: https://ai.meta.com/blog/meta-llama-3-1 # TL;DR ЧТО сделали: Авторы провели строгое эмпирическое сравнение прунинга (удаления весов) и обучения с нуля для небольших языковых моделей (LLM) с выравниванием по количеству токенов. Оценив шесть методов прунинга на пяти уровнях детализации (по глубине, ширине, совместный по глубине и ширине, полуструктурированный 2:4 и неструктурированный), исследователи выделили ценность инициализации вырезанными весами в двух режимах: при равном бюджете токенов на дообучение и при равном суммарном бюджете токенов на весь пайплайн. ПОЧЕМУ это важно: Работа меняет взгляд на прунинг нейросетей: это не просто метод сжатия post-hoc, а скорее стратегия эффективной инициализации. Важнейший вывод: когда суммарные вычислительные ресурсы и бюджет токенов выравниваются для всего пайплайна, грубый структурированный прунинг работает в основном как поиск нейросетевых архитектур (NAS). Его результаты можно повторить или превзойти, просто обучив меньшую плотную (dense) архитектуру с нуля. Напротив, мелкозернистый (fine-grained) спарс-прунинг передаёт специфические знания на уровне отдельных весов, которые не удаётся восполнить просто добавлением токенов при обучении. Для практиков: Для руководителей R&D и инженеров статья даёт чёткое правило. Если у вас есть сильная предобученная родительская модель, а данные для дообучения строго ограничены, прунинг даст отличную фору по сравнению со случайной инициализацией. Однако если целевых данных предостаточно, а для деплоя требуется плотная архитектура, предобучать огромную модель только ради структурированного прунинга вычислительно невыгодно. В таком режиме разумнее потратить весь бюджет токенов на прямое обучение целевой небольшой плотной модели с нуля — вы получите аналогичное или даже лучшее качество. Коцать ллмки тут: https://t.me/gonzo_ML_podcasts/4676
Интересные находки про обучение малых LLM из предобученных больших. Small LLMs:…
Из этого канала
- #5843Что-то любопытное, но требует вдумчивого чтения. Requential Coding: Pushing the…
Что-то любопытное, но требует вдумчивого чтения. Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data Shikai Qiu, Marc…
- #5832Как-то так получилось, что мы в канале разбирали почти все около-Лекуновские…
Как-то так получилось, что мы в канале разбирали почти все около-Лекуновские подходы к self-supervised.
- #5823"Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков…
"Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков сравнимы с коммерческими фронтир моделями.
- #5822Если что, прямо сейчас Фристон выступает…
Если что, прямо сейчас Фристон выступает https://www.youtube.com/watch?v=qRA1DoMCCSc