Прикольная работа про экономию памяти для работы с длинными последовательностями. Использует то же наблюдение, что и недавняя работа про новый BERT — семантика стабилизируется уже к середине сети, слои позже работают больше на предсказание следующего токена (или какая там у вас задача). Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory __Hanzuo Liu, Xuan Qi, Chunyu Liu, Haotian Zhong, Yulong Wang, Rayying, Key, Alex Lamb, Mingyu Gao__ Paper: https://arxiv.org/abs/2607.28263 Code: https://github.com/liuhanzuo/COMem # TL;DR ЧТО сделали: Авторы представляют CoMem (Comprehension Memory) — архитектуру контекстной памяти с разделением по глубине, которая перестраивает обработку длинного контекста вдоль оси слоёв, а не токенов. Во время потоковой записи (WRITE) чанки контекста прогоняются через нижние слои трансформера `[0:j]`, чтобы сохранить единое промежуточное состояние резидуального потока (residual state) для каждого токена. Это требует всего `1/18` объёма памяти по сравнению с полным KV-кэшем на Qwen3-8B. Во время чтения (READ) внешний BM25-ретривер выбирает ограниченный пак релевантных чанков, и верхние слои `[j:L]` пересчитываются над этим паком с использованием полного cross-chunk причинного внимания (causal attention). Самодистиллированный LoRA адаптер с рангом 32, обученный на обычном тексте, восстанавливает точность считывания верхних слоёв без изменения весов основной модели (backbone). ПОЧЕМУ это важно: Стандартный инференс длинного контекста упирается в квадратичную сложность префилла и линейный рост KV-кэша. Существующие методы удаления токенов урезают долговременные зависимости, а подходы с полным перерасчётом требуют линейного роста памяти. Используя разделение труда по слоям — когда семантическое понимание стабилизируется на ранних слоях, а верхние специализируются на предсказании — CoMem отключает зависимость онлайн-вычислений и памяти GPU от общей длины сохранённого контекста. На 128k контекста на GPU NVIDIA H20 CoMem даёт ускорение префилла в `7.83` раза и снижает пиковую память с 89.36 ГБ до 18.26 ГБ, при этом превосходя полноконтекстные бейзлайны на бенчмарках длинных диалогов. Для практиков: Сохранение контекста безграничной длины больше не требует удержания глубоких KV-кэшей на миллионы токенов в памяти GPU. Предварительный расчёт промежуточных резидуальных векторов оффлайн и выполнение онлайн-запросов над извлечённым паком фиксированного размера через верхние слои трансформера строго ограничивают затраты на инференс. Эта архитектура обеспечивает бесконечную контекстную память для диалоговых агентов и систем поиска по документам с субсекундной задержкой префилла и минимальным расходом VRAM. Экономить память тут: https://t.me/gonzo_ML_podcasts/4791