Недавно писал про прикольный подход Recirculation, а тут уже и его развитие подоспело (от конкурирующей команды) Write Back the Δ: Revisiting the Same Tokens with Fresh Representations __Wencheng Ye, Anning Hu, Xiangdong Zhang, Tianyi Wang, Yikang Li, Hengyu Jin, Bing Li, Junchi Yan__ Paper: https://arxiv.org/abs/2609.32457 Review: https://arxiviq.substack.com/p/recirculation Code: https://github.com/gooogleshanghai/reflux ЧТО сделали: Авторы представили ReFlux — метод, который возвращает вычисленные инкременты глубины из глубоких слоёв трансформера в более ранние слои через разреженный обучаемый граф обратной связи, зависящий от входа, поверх замороженной языковой модели. ЧТО получили: На восьми бенчмарках на рассуждение ReFlux улучшает среднюю точность на 2.1–2.3 процентных пункта относительно базовых чекпоинтов (прирост на 4.7 п.п. на 2WikiMultiHopQA с 38.5% до 43.2% на Gemma3-4B против 38.6% у Recirculation и 38.9% у TF-Loop). Перплексия на C4 для Gemma3-4B снизилась с 23.8 до 20.9. В потоковом режиме эти улучшения сохраняются при 1× теоретических FLOPs бэкбона и задержке декодирования 1.02×–1.08×. ПОЧЕМУ это важно: Языковые модели могут уточнять промежуточные репрезентации без повторного прогона всех слоёв и без траты лишних токенов на длинные цепочки рассуждений. Однако для продакшена потребуются кастомные ядра, чтобы убрать накладные расходы при декодировании. Подробнее тут: https://t.me/gonzo_ML_podcasts/4818
Недавно писал про прикольный подход Recirculation, а тут уже и его развитие…
Из этого канала
- #6075По свежим запросам читателей. Это какая-то интересная статья — получается, что…
По свежим запросам читателей. Это какая-то интересная статья — получается, что достаточно двух случайно инициализированных голов внимания, в правильном порядке…
- #6068В работе с таблицами, кажется, случается свой Jev-moment — вышла новая…
В работе с таблицами, кажется, случается свой Jev-moment — вышла новая маленькая и быстрая фундаментальная табличная модель, которая бьёт всех на zero-shot,…
- #6065Команда из DeepMind продолжает поиски сознания. From cacophony to hierarchy: a…
Команда из DeepMind продолжает поиски сознания. From cacophony to hierarchy: a principled framework for assessing AI consciousness Shamil Chandaria, Arvo Muñoz…
- #6062Экспонента в статьях, экспонента в коде, что ещё? Какой прекрасный толк :)…
Экспонента в статьях, экспонента в коде, что ещё? Какой прекрасный толк :) https://youtu.be/vDjWdRyKXY?is=opUGqNWz7C7CngDp