Улучшенный зацикленный трансформер с латентным ризонингом, который теперь работает для языковой модели размером 3B и не теряет в качестве по сравнению с обычным текстовым CoT. И при этом быстрее в несколько раз. Сочетание universal transformer (шаренные веса и сильно уменьшенный memory footprint по сравнению с полным трансформером) и латентного ризонинга (более быстрая генерация, поскольку обходим бутылочное горлышко токенизации, а тут ещё и параллелим процесс) — это сильное комбо. Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers __Ying Fan, Anej Svete, Kangwook Lee__ Paper: https://arxiv.org/abs/2606.31779 Review: https://arxiviq.substack.com/p/bridging-the-gap-between-latent-and Code: https://github.com/yingfan-bot/lotus Model: N/A # TL;DR ЧТО сделали: Авторы представляют LOTUS (Looped Transformers with parallel supervision on latents) — новый фреймворк для латентных рассуждений. Он проецирует последовательные шаги цепочки рассуждений (CoT) в непрерывные латентные блоки, которые обрабатываются параллельно с помощью циклической (looped) архитектуры трансформера с разделяемыми весами. В отличие от предыдущих латентных методов, страдающих от дрейфа репрезентаций и бутылочного горлышка последовательной генерации, LOTUS использует параллельный прямой надзор (supervision) на уровне токенов через собственную голову языкового моделирования базовой модели. ПОЧЕМУ это важно: Хотя явные цепочки рассуждений (explicit CoT) обеспечивают высокую точность, их последовательная генерация токен за токеном работает медленно и требует больших вычислительных ресурсов. LOTUS — это первый метод латентных рассуждений, который успешно преодолел разрыв в качестве по сравнению с явным CoT на масштабе моделей в 3B параметров. Он сохраняет точность, обеспечивая ускорение фазы размышлений в 2.5–6.9 раза, предлагая эффективную альтернативу для масштабирования вычислений на этапе инференса (test-time compute). Для практиков: LOTUS позволяет перенести «мыслительный процесс» LLM в скрытые состояния без потери качества и значительно ускорить инференс на GPU (особенно на фазе генерации рассуждений), избавляя от необходимости дорогого последовательного авторегрессионного декодирования длинных CoT-цепочек. Крутить латенты тут: https://t.me/gonzo_ML_podcasts/4511
Улучшенный зацикленный трансформер с латентным ризонингом, который теперь…
Из этого канала
- #5760Just in case, я неожиданно стал соорганизатором конференции Superintelligence…
Just in case, я неожиданно стал соорганизатором конференции Superintelligence Conference (SiC26), которая пройдёт в этом году 9-11 сентября в Университете…
- #5755Большие модели — это, конечно, классно, но это удел избранных. Нам, простым…
Большие модели — это, конечно, классно, но это удел избранных. Нам, простым смертным, нужно что-то разумного размера, но способное работать с задачами на…
- #5752"В комнату входит состязательная психометрика. Забавно, что ""персоны"" моделей…
"В комнату входит состязательная психометрика. Забавно, что ""персоны"" моделей существенно разные — Клод кооперативен, а GPT склонна к обману.