Прикольная работа про экономию памяти для работы с длинными последовательностями. Использует то же наблюдение, что и недавняя работа про новый BERT — семантика стабилизируется уже к середине сети, слои позже работают больше на предсказание следующего токена (или какая там у вас задача). Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory __Hanzuo Liu, Xuan Qi, Chunyu Liu, Haotian Zhong, Yulong Wang, Rayying, Key, Alex Lamb, Mingyu Gao__ Paper: https://arxiv.org/abs/2607.28263 Code: https://github.com/liuhanzuo/COMem # TL;DR ЧТО сделали: Авторы представляют CoMem (Comprehension Memory) — архитектуру контекстной памяти с разделением по глубине, которая перестраивает обработку длинного контекста вдоль оси слоёв, а не токенов. Во время потоковой записи (WRITE) чанки контекста прогоняются через нижние слои трансформера `[0:j]`, чтобы сохранить единое промежуточное состояние резидуального потока (residual state) для каждого токена. Это требует всего `1/18` объёма памяти по сравнению с полным KV-кэшем на Qwen3-8B. Во время чтения (READ) внешний BM25-ретривер выбирает ограниченный пак релевантных чанков, и верхние слои `[j:L]` пересчитываются над этим паком с использованием полного cross-chunk причинного внимания (causal attention). Самодистиллированный LoRA адаптер с рангом 32, обученный на обычном тексте, восстанавливает точность считывания верхних слоёв без изменения весов основной модели (backbone). ПОЧЕМУ это важно: Стандартный инференс длинного контекста упирается в квадратичную сложность префилла и линейный рост KV-кэша. Существующие методы удаления токенов урезают долговременные зависимости, а подходы с полным перерасчётом требуют линейного роста памяти. Используя разделение труда по слоям — когда семантическое понимание стабилизируется на ранних слоях, а верхние специализируются на предсказании — CoMem отключает зависимость онлайн-вычислений и памяти GPU от общей длины сохранённого контекста. На 128k контекста на GPU NVIDIA H20 CoMem даёт ускорение префилла в `7.83` раза и снижает пиковую память с 89.36 ГБ до 18.26 ГБ, при этом превосходя полноконтекстные бейзлайны на бенчмарках длинных диалогов. Для практиков: Сохранение контекста безграничной длины больше не требует удержания глубоких KV-кэшей на миллионы токенов в памяти GPU. Предварительный расчёт промежуточных резидуальных векторов оффлайн и выполнение онлайн-запросов над извлечённым паком фиксированного размера через верхние слои трансформера строго ограничивают затраты на инференс. Эта архитектура обеспечивает бесконечную контекстную память для диалоговых агентов и систем поиска по документам с субсекундной задержкой префилла и минимальным расходом VRAM. Экономить память тут: https://t.me/gonzo_ML_podcasts/4791
Прикольная работа про экономию памяти для работы с длинными…
Из этого канала
- #5935Соскучились по новым законам скейлинга? Их есть у меня! Для более критического…
Соскучились по новым законам скейлинга? Их есть у меня! Для более критического восприятия добавил прожарку.
- #5942Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они…
Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они регулярно берут какую-то из базовых Gemma и делают из неё то полноценный…
- #5950Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много…
Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много писали про динамические вычисления, когда слои вычисляются в разном порядке, с…
- #5926По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with…
По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with Compute Flexibility Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang,…
- #5922Тема про термодинамические вычисления развивается (мы писали про неё тут, тут и…
Тема про термодинамические вычисления развивается (мы писали про неё тут, тут и тут). Extropic анонсировал новую Z1 в дополнение к X0/XTR-0.