Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge устройств. Не всё так просто, рекурсия особо чувствительна к накоплению ошибок квантования. What Survives When You Compress a Recursive Reasoner for the Edge? __Pearse Jim, Steven Kolawole, Opegbemi M. Busoye, Glory Bagai, Virginia Smith__ Paper: https://arxiv.org/abs/2606.26488 Review: https://arxiviq.substack.com/p/what-survives-when-you-compress-a Code: N/A Model: N/A # TL;DR ЧТО сделали: Авторы провели первое систематическое исследование сжатия рекурсивных рассуждающих моделей (recursive reasoning models) в условиях жёстких ограничений на память SRAM на граничных устройствах. Они детально проанализировали влияние пост-обучающего квантования (PTQ), структурированного прунинга и дистилляции знаний на компактные архитектуры вроде Tiny Recursive Model (TRM) (https://t.me/gonzo_ML/4127) и Hierarchical Reasoning Model (HRM) (https://t.me/gonzo_ML/4097). В процессе исследователи выявили критический режим сбоя — «композиционный коллапс» (compositional collapse), при котором локальная точность предсказаний сохраняется, но глобальная точность решения задач падает до нуля. Для диагностики этой проблемы они предложили метрику без учителя — точность траектории переноса (carry-trajectory fidelity), а также представили конвейер развёртывания с потоковой загрузкой эмбеддингов из флеш-памяти и поканально откалиброванным 4-битным квантованием. ПОЧЕМУ это важно: Работа показывает, что стандартная интуиция по сжатию однопроходных (single-pass) моделей неприменима к рекурсивным архитектурам. В последних шум квантования накапливается экспоненциально по циклам рекурсии, а не по выходным токенам. Открытие композиционного коллапса доказывает, что стандартные токеновые лоссы (вроде кросс-энтропии при квантовании с обучением (QAT) или дистилляции) в корне не соответствуют глобальным ограничениям задач на рассуждение. Для практиков: Предложен готовый инженерный рецепт для запуска сложных планирующих архитектур с миллионами параметров на маломощном граничном оборудовании с жёсткими ограничениями на SRAM (от 4 до 8 МБ) без потери глобальной точности решения задач. Переносить рекурсию на edge здесь: https://t.me/gonzo_ML_podcasts/4528
Снова про зацикленные трансформеры, но на этот раз в контексте сжатия для edge…
Из этого канала
- #5761Улучшенный зацикленный трансформер с латентным ризонингом, который теперь…
Улучшенный зацикленный трансформер с латентным ризонингом, который теперь работает для языковой модели размером 3B и не теряет в качестве по сравнению с…
- #5760Just in case, я неожиданно стал соорганизатором конференции Superintelligence…
Just in case, я неожиданно стал соорганизатором конференции Superintelligence Conference (SiC26), которая пройдёт в этом году 9-11 сентября в Университете…
- #5755Большие модели — это, конечно, классно, но это удел избранных. Нам, простым…
Большие модели — это, конечно, классно, но это удел избранных. Нам, простым смертным, нужно что-то разумного размера, но способное работать с задачами на…