Что-то любопытное, но требует вдумчивого чтения. Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data __Shikai Qiu, Marc Finzi, Yujia Zheng, Kun Zhang, Andrew Gordon Wilson__ Paper: https://arxiv.org/abs/2607.11883 Code: https://github.com/shikaiqiu/requential-coding Review: https://arxiviq.substack.com/p/requential-coding-pushing-the-limits Model: N/A # TL;DR ЧТО сделали: Авторы представляют requential coding — фреймворк сжатия генеративных моделей с потерями, который сжимает модель путём кодирования траектории её обучения, а не самих весов. В этой схеме модель-ученик (student) итеративно обучается на синтетических данных, которые генерирует сама, а наиболее подходящие примеры отбирает более сильная модель-учитель (teacher). Использование относительного энтропийного кодирования (relative entropy coding) позволяет ограничить затраты на передачу только «разногласиями» между учеником и учителем. Это избавляет от необходимости кодировать огромное число параметров или бороться с неустранимой энтропией данных, которые раздувают классические схемы сжатия. ПОЧЕМУ это важно: Фреймворк разрешает давний парадокс глубокого обучения: почему огромные перепараметризованные модели отлично обобщают, несмотря на свою избыточную ёмкость. Requential coding позволяет получить длину кода на порядки меньше, чем классическое квантование весов или традиционное преквенциальное кодирование (prequential coding). Это обеспечивает первые нетривиальные (non-vacuous) гарантии обобщающей способности PAC-Bayes для LLM с миллиардами параметров. Что критически важно, доказанный зазор обобщения (generalization gap) сужается по мере масштабирования моделей в оптимальном по вычислительным ресурсам режиме. Это напрямую связывает законы масштабирования (scaling laws) с классическим принципом бритвы Оккама. Для практиков: Хотя метод пока сложен в вычислительном плане для передачи весов по сети, он даёт мощный инструмент для курирования датасетов (через расчёт «эпиплексии») и открывает дорогу к теоретически обоснованным методам федеративного обучения и слияния моделей без необходимости пересылать гигабайты весов. Сделал две версии обзора: 1. Посложнее https://t.me/gonzo_ML_podcasts/4690 2. Попроще https://t.me/gonzo_ML_podcasts/4706 Поставьте реакцию, какой лучше, 🔥для первого, ❤️ для второго. Можно какаху, если вы прочитали саму статью и никакой не лучше :)
Что-то любопытное, но требует вдумчивого чтения. Requential Coding: Pushing the…
Из этого канала
- #5838Интересные находки про обучение малых LLM из предобученных больших. Small LLMs:…
Интересные находки про обучение малых LLM из предобученных больших. Small LLMs: Pruning vs.
- #5832Как-то так получилось, что мы в канале разбирали почти все около-Лекуновские…
Как-то так получилось, что мы в канале разбирали почти все около-Лекуновские подходы к self-supervised.
- #5823"Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков…
"Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков сравнимы с коммерческими фронтир моделями.