Про важность хороших бейзлайнов и качественную сантехнику. Sliding-Window Beats Linear Attention __Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais__ Paper: https://arxiv.org/abs/2608.28444v1 Review: https://arxiviq.substack.com/p/sliding-window-beats-linear-attention ЧТО сделали: Авторы поставили под сомнение популярную практику дистилляции стандартных квадратичных LLM в линейные декодеры и гибридные state-space модели. Проведя систематический бенчмарк на семействах моделей от 1.3B до 70B параметров, исследователи показали: обычный механизм Sliding Window Attention с начальными attention sinks, обозначаемый как SWA(w, s), вообще без дообучения не уступает сложным пост-обученным линейным архитектурам на стандартных downstream-задачах, а в длинном контексте и задачах на рассуждение с разгромом их побеждает. ПОЧЕМУ это важно: Последние пару лет индустрия вливала огромные ресурсы в дистилляцию полносвязных трансформеров в линейные альтернативы вроде LoLCATs и Liger-GLA, стремясь побороть линейный рост KV-кэша. Эта статья вскрывает фундаментальную методологическую ошибку предшественников: линейные методы сравнивали с некорректным бейзлайном — скользящим окном без синк-токенов, которое неизбежно деградирует. Если же взять корректный бейзлайн — локальное окно всего с четырьмя статическими токенами в начале, — многостадийная дистилляция, LoRA-адаптеры и кастомные аппаратные кернелы оказываются попросту лишними. Для практиков: Обслуживание современных моделей обходится дорого: каждый новый токен диалога раздувает KV-кэш, сжирая видеопамять GPU и замедляя генерацию. Чтобы с этим справиться, инженеры городили замысловатые схемы дистилляции, упаковывая историю контекста в скрытое состояние фиксированного размера. Как выяснилось, элементарный трюк без обучения — закрепить первые 4 токена в роли «якоря» и поддерживать небольшое скользящее окно недавних токенов — даёт сравнимое или даже более высокое качество на бенчмарках, декодирует токены быстрее, расходует меньше памяти и в 2–10 раз превосходит дистиллированные линейные модели при поиске фактов в длинном контексте. Не нужно городить дорогие пайплайны дообучения ради экономии памяти на инференсе: стандартные кернелы внимания с локальным окном и attention sinks обеспечивают превосходную Парето-эффективность прямо из коробки. Прокачивать слив тут: https://t.me/gonzo_ML_podcasts/4803