"Статья от команды Qwen взяла награду Best Paper Award на NeurIPS 2025 Работа называется ""Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free"". В ней исследователи предложили новый вид механизма внимания – gated attention. Суть в том, что на выход каждой attention-головы мы добавляем сигмоидную шторку, которая масштабирует аутпуты. Фактически, из Attention → Output мы делаем Attention → Sigmoid-gate × Output. Причем гейт – это обучаемый блок. Интуитивно, гейт учится понимать, насколько голова полезна в конкретном случае, и насколько, следовательно, нужно усилить или заглушить ее сигнал. В целом хак небольшой, но оказывается, что прокачивает и стабильность обучения, и итоговое качество. А еще помогает избегать залипания внимания на первых токенах и деградации способностей при увеличении контекста. Короче, работа правда достойная (почитать можно здесь). Так что поздравляем Qwen с очередным успехом."
"Статья от команды Qwen взяла награду Best Paper Award на NeurIPS 2025 Работа…
Из этого канала
- #8372⚡️ Вышел DeepSeek-Math-V2 С релиза первой версии прошло почти два года. Новую…
⚡️ Вышел DeepSeek-Math-V2 С релиза первой версии прошло почти два года. Новую уже никто и не ждал, но релиз, как это часто бывает в случае с DeepSeek, наступил…
- #8375Потестили новый Claude Opus 4.5, кстати, отличная модель ⬆️
Потестили новый Claude Opus 4.5, кстати, отличная модель ⬆️
- #8376Прошел интересный слух, что в 2026 Nvidia больше не будет продавать партнерам…
Прошел интересный слух, что в 2026 Nvidia больше не будет продавать партнерам память То есть вместо того, чтобы поставлять кристалл в комплекте с микросхемами…
- #8370Я на любом рабочем дейлике, когда речь заходит о моих задачах
Я на любом рабочем дейлике, когда речь заходит о моих задачах
- #8369В честь пятилетия AlphaFold Google впервые выложили в бесплатный доступ фильм…
В честь пятилетия AlphaFold Google впервые выложили в бесплатный доступ фильм про DeepMind Картина называется The Thinking Game, наверняка кто-то из вас ее уже…