Прикольный заход на оптимизацию KV-кешей, когда модель сама может подсветить, куда собирается смотреть, пометить это тегами, а на инференсе vLLM быстро подстроится и не будет грузить лишнего. Language Models Can Control Their Own Attention __Namgyu Ho, Huzama Ahmad, Woosung Koh, Se-Young Yun, Tal Schuster, Cicero Nogueira dos Santos__ Paper: https://arxiv.org/abs/2609.02737v1 Review: https://arxiviq.substack.com/p/language-models-can-control-their Code: N/A Model: N/A ЧТО сделали: Авторы представили Declarative Attention (DA) — универсальный zero-shot протокол для инференса, в котором стандартный авторегрессионный трансформер самостоятельно управляет доступом к собственному KV-кэшу. Генерируя структурированные текстовые теги прямо в процессе цепочки рассуждений (CoT), модель динамически переключается между тремя режимами: глобальным обзором всего контекста, точечной фокусировкой на конкретных смысловых фрагментах и локальным синтезом, изолированным в рамках недавних сгенерированных токенов. Конечный автомат рантайма перехватывает эти теги в момент генерации токенов и напрямую обновляет таблицу блоков в vLLM. Это позволяет отсекать неиспользуемые блоки памяти в FlashAttention без файнтюнинга модели, вспомогательных сетей маршрутизации или деструктивного удаления токенов. ПОЧЕМУ это важно: При генерации на сверхдлинных контекстах пропускная способность памяти, необходимая для постоянного вычитывания многогигабайтных KV-кэшей из HBM, начинает полностью доминировать над задержкой декодинга и операционными расходами. Существующие методы разреженного внимания пытаются бороться с этим через эвристический прунинг или легковесные обучаемые роутеры, однако на каждом шаге генерации они по-прежнему требуют прохода сложности O(N) по латентным состояниям или суррогатным проекциям. Declarative Attention доказывает, что современные фронтирные модели уже обладают метакогнитивной способностью предсказывать и формулировать свои информационные потребности на естественном языке. Это меняет подход: вместо неявного поиска сложности O(N) на каждом шаге мы получаем семантический протокол управления со сложностью O(1). Подход сокращает вычислительные затраты на внимание при декодинге на 31.1–52.0% практически без просадки в точности, открывая путь к прозрачному многоуровневому хранению и недеструктивному офлоадингу контекста. Для практиков: Когда языковая модель обрабатывает документы на сотни тысяч слов, вычислительное бутылочное горлышко смещается от мощности матричных процессоров к пропускной способности памяти: модель тратит львиную долю времени на повторное чтение огромного кэша предыдущего текста только ради того, чтобы найти пару релевантных фактов для очередного сгенерированного слова. Раньше для ускорения либо безвозвратно удаляли токены (что часто ломало сложные рассуждения), либо на каждом шаге сканировали сжатое представление всего документа, что остаётся накладным. В этой статье предлагают изящную альтернативу: научить модель прямо говорить, куда именно она хочет посмотреть. Модель сама объявляет, нужно ли ей просканировать весь документ, сфокусироваться на конкретной главе или просто поразмышлять во внутреннем черновике, а инфраструктура инференса на лету отключает доступ к ненужным блокам текста. На 15 бенчмарках длинного контекста без какого-либо дообучения метод сократил обращения к памяти до 52% при сохранении базовой точности, причём эффект только усиливается по мере роста размера и возможностей моделей. Контролировать внимание тут: https://t.me/gonzo_ML_podcasts/4801
Прикольный заход на оптимизацию KV-кешей, когда модель сама может подсветить,…
Из этого канала
- #5992Передавая когнитивные функции ллмкам, полезно представлять, как вы их заберёте…
Передавая когнитивные функции ллмкам, полезно представлять, как вы их заберёте обратно, если понадобится.
- #5989В твиттере новая мания - нейросети по схеме мозга настоящей мухи. За последние…
В твиттере новая мания - нейросети по схеме мозга настоящей мухи. За последние несколько дней я видел десяток демо, где мозг настоящей мухи заставляют играть в…
- #5988А вот и продолжение темы про мух )
А вот и продолжение темы про мух )