Что-то любопытное, но требует вдумчивого чтения. Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data __Shikai Qiu, Marc Finzi, Yujia Zheng, Kun Zhang, Andrew Gordon Wilson__ Paper: https://arxiv.org/abs/2607.11883 Code: https://github.com/shikaiqiu/requential-coding Review: https://arxiviq.substack.com/p/requential-coding-pushing-the-limits Model: N/A # TL;DR ЧТО сделали: Авторы представляют requential coding — фреймворк сжатия генеративных моделей с потерями, который сжимает модель путём кодирования траектории её обучения, а не самих весов. В этой схеме модель-ученик (student) итеративно обучается на синтетических данных, которые генерирует сама, а наиболее подходящие примеры отбирает более сильная модель-учитель (teacher). Использование относительного энтропийного кодирования (relative entropy coding) позволяет ограничить затраты на передачу только «разногласиями» между учеником и учителем. Это избавляет от необходимости кодировать огромное число параметров или бороться с неустранимой энтропией данных, которые раздувают классические схемы сжатия. ПОЧЕМУ это важно: Фреймворк разрешает давний парадокс глубокого обучения: почему огромные перепараметризованные модели отлично обобщают, несмотря на свою избыточную ёмкость. Requential coding позволяет получить длину кода на порядки меньше, чем классическое квантование весов или традиционное преквенциальное кодирование (prequential coding). Это обеспечивает первые нетривиальные (non-vacuous) гарантии обобщающей способности PAC-Bayes для LLM с миллиардами параметров. Что критически важно, доказанный зазор обобщения (generalization gap) сужается по мере масштабирования моделей в оптимальном по вычислительным ресурсам режиме. Это напрямую связывает законы масштабирования (scaling laws) с классическим принципом бритвы Оккама. Для практиков: Хотя метод пока сложен в вычислительном плане для передачи весов по сети, он даёт мощный инструмент для курирования датасетов (через расчёт «эпиплексии») и открывает дорогу к теоретически обоснованным методам федеративного обучения и слияния моделей без необходимости пересылать гигабайты весов. Сделал две версии обзора: 1. Посложнее https://t.me/gonzo_ML_podcasts/4690 2. Попроще https://t.me/gonzo_ML_podcasts/4706 Поставьте реакцию, какой лучше, 🔥для первого, ❤️ для второго. Можно какаху, если вы прочитали саму статью и никакой не лучше :)