Что если дать модели возможность переписывать контекст? Так чтобы она работала с ним как с файлом? Простая и гениальная идея, не понимаю, почему её раньше никто не довёл в таком виде. Сплошные профиты: многие вещи из контекста не нужны после того как получен результат, запросто можно урезать лишнее ненужное и сэкономить вычислений. Да, после точки редактирования летят KV-кеши, но для неизменившейся части можно быстро пересчитать RoPE эмбеддинги и не делать полный prefill. Эта часть вообще потенциально много где полезна. Зачётная работа, респект авторам! Context Language Models __Rulin Shao, Shannon Zejiang Shen, Junjie Oscar Yin, Yuetai Li, Minheng Wang, Hamish Ivison, Radha Poovendran, Nathan Lambert, Teng Xiao, Mike Lewis, Wen-tau Yih, Luke Zettlemoyer, Pang Wei Koh__ Paper: https://arxiv.org/abs/2609.37725 Review: https://arxiviq.substack.com/p/context-language-models Code: https://github.com/facebookresearch/context-language-models ЧТО сделали: Предложили подход Context Language Models (CLM): контекст агента хранится как редактируемый файл на диске. Модель сама читает, сжимает и переписывает его командами Bash и Python вместо внешних эвристик суммаризации. Чтобы правки в середине контекста не заставляли заново вычислять KV-кэш, авторы создали патч для SGLang — Suffix Cache Reuse (SCR), который сохраняет и перемещает кэшированные активации суффикса. ЧТО получили: В режиме zero-shot модель Qwen3.6-27B с CLM достигла точности 59.4% на BrowseComp-Plus (относительный прирост 11.4% по сравнению с 53.3% у суммаризации в духе Codex) при снижении FLOPs на 21.5%. На Software World модель показала ускорение на 65% выше при том же объёме вычислений. Пошаговый GRPO поднял точность Qwen3.5-9B с 28.8% до 42.5%, сократив FLOPs на 12%. ПОЧЕМУ это важно: Прямой доступ на запись в собственный контекст избавляет от хрупких эвристик сжатия при долгой работе агента. Однако из-за слабого ощущения размера контекста модели пока требуется внешнее напоминание о расходе токенов. Переписывать контекст здесь: https://t.me/gonzo_ML_podcasts/4824
Что если дать модели возможность переписывать контекст? Так чтобы она работала…
Из этого канала
- #6089Прикольный результат. Не все чекпойнты одинаково полезны. Очередная лотерея.…
Прикольный результат. Не все чекпойнты одинаково полезны. Очередная лотерея. Generalization Dynamics of LM Pre-Training Jiaxin Wen, Zhengxuan Wu, Dawn Song,…
- #6086Декомпозиция RSI :) The Last AI Built by Humans: Toward Genuine Recursive…
Декомпозиция RSI :) The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement Yi Duan, Ying Liu, Zirui Tang, Haodong Chen, Jun Zhou, Yumou Liu,…
- #6085Свежий репорт от Натана https://www.stateof.ai/ В меру краткий анонс…
Свежий репорт от Натана https://www.stateof.ai/ В меру краткий анонс https://nathanbenaich.substack.com/p/state-of-ai-2026