"Статья от команды Qwen взяла награду Best Paper Award на NeurIPS 2025 Работа называется ""Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free"". В ней исследователи предложили новый вид механизма внимания – gated attention. Суть в том, что на выход каждой attention-головы мы добавляем сигмоидную шторку, которая масштабирует аутпуты. Фактически, из Attention → Output мы делаем Attention → Sigmoid-gate × Output. Причем гейт – это обучаемый блок. Интуитивно, гейт учится понимать, насколько голова полезна в конкретном случае, и насколько, следовательно, нужно усилить или заглушить ее сигнал. В целом хак небольшой, но оказывается, что прокачивает и стабильность обучения, и итоговое качество. А еще помогает избегать залипания внимания на первых токенах и деградации способностей при увеличении контекста. Короче, работа правда достойная (почитать можно здесь). Так что поздравляем Qwen с очередным успехом."