Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge устройств. Не всё так просто, рекурсия особо чувствительна к накоплению ошибок квантования. What Survives When You Compress a Recursive Reasoner for the Edge? __Pearse Jim, Steven Kolawole, Opegbemi M. Busoye, Glory Bagai, Virginia Smith__ Paper: https://arxiv.org/abs/2606.26488 Review: https://arxiviq.substack.com/p/what-survives-when-you-compress-a Code: N/A Model: N/A # TL;DR ЧТО сделали: Авторы провели первое систематическое исследование сжатия рекурсивных рассуждающих моделей (recursive reasoning models) в условиях жёстких ограничений на память SRAM на граничных устройствах. Они детально проанализировали влияние пост-обучающего квантования (PTQ), структурированного прунинга и дистилляции знаний на компактные архитектуры вроде Tiny Recursive Model (TRM) (https://t.me/gonzo_ML/4127) и Hierarchical Reasoning Model (HRM) (https://t.me/gonzo_ML/4097). В процессе исследователи выявили критический режим сбоя — «композиционный коллапс» (compositional collapse), при котором локальная точность предсказаний сохраняется, но глобальная точность решения задач падает до нуля. Для диагностики этой проблемы они предложили метрику без учителя — точность траектории переноса (carry-trajectory fidelity), а также представили конвейер развёртывания с потоковой загрузкой эмбеддингов из флеш-памяти и поканально откалиброванным 4-битным квантованием. ПОЧЕМУ это важно: Работа показывает, что стандартная интуиция по сжатию однопроходных (single-pass) моделей неприменима к рекурсивным архитектурам. В последних шум квантования накапливается экспоненциально по циклам рекурсии, а не по выходным токенам. Открытие композиционного коллапса доказывает, что стандартные токеновые лоссы (вроде кросс-энтропии при квантовании с обучением (QAT) или дистилляции) в корне не соответствуют глобальным ограничениям задач на рассуждение. Для практиков: Предложен готовый инженерный рецепт для запуска сложных планирующих архитектур с миллионами параметров на маломощном граничном оборудовании с жёсткими ограничениями на SRAM (от 4 до 8 МБ) без потери глобальной точности решения задач. Переносить рекурсию на edge здесь: https://t.me/gonzo_ML_podcasts/4528
Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge…
Из этого канала
- #5772Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов.…
Шмидхубер и ко написали 97-страничный обзор про самоулучшающихся агентов. Построено на идее, что агент — это параметры модели + харнесс, At = (θt, Σt).
- #5778Замена LLM-as-a-Judge. Там где судья схлопывает свои представления в токены и…
Замена LLM-as-a-Judge. Там где судья схлопывает свои представления в токены и выдаёт текстовый ответ, близкие (но несовпадающие) решения часто неразличимы.
- #5785Соскучились по Берту? Лекун не дремлет! Проблема с традиционным Бертом и его…
Соскучились по Берту? Лекун не дремлет! Проблема с традиционным Бертом и его новомодными улучшениями (мы разбирали ModernBERT, https://t.me/gonzoML/3090) в…
- #5761Улучшенный зацикленный трансформер с латентным ризонингом, который теперь…
Улучшенный зацикленный трансформер с латентным ризонингом, который теперь работает для языковой модели размером 3B и не теряет в качестве по сравнению с…
- #5760Just in case, я неожиданно стал соорганизатором конференции Superintelligence…
Just in case, я неожиданно стал соорганизатором конференции Superintelligence Conference (SiC26), которая пройдёт в этом году 9-11 сентября в Университете…