"Ну и чего-нибудь более классического для тех, кому про жызнь менее интересно. Новости зацикленных трансформеров, модель примерно продакшн уровня. The Compute-Matched Paradigm: Rethinking Recurrent Depth with the Loopie Series __Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai__ Paper: https://arxiv.org/abs/2607.16051 Review: https://arxiviq.substack.com/p/loop-the-loopies Code: https://github.com/IQuestLab/loopie/megatron, https://github.com/IQuestLab/loopie/vllm (404 for now) Model: https://huggingface.co/IQuestLab/Loopie-20B-A2B-preview, https://huggingface.co/IQuestLab/Loopie-6B-A0.6B-preview (404 for now) # TL;DR ЧТО сделали: Авторы из IQuest Research представили семейство Loopie — новый класс рекуррентных языковых моделей (LLM) с архитектурой Mixture-of-Experts (MoE), где используется механизм ""layer-loop"" (зацикливание отдельных слоёв). Разработав подход к масштабированию с учётом железа, исследователи сбалансировали физическую глубину, ширину и рекуррентную глубину сети так, чтобы уместиться в вычислительный бюджет на предобучение, аналогичный нерекуррентным бейзлайнам. После предобучения модели дообучались с помощью масштабного пайплайна Supervised Pre-Training (SPT) и обучения с подкреплением (RL) на уровне последовательностей для развития продвинутых способностей к рассуждению. ПОЧЕМУ это важно: Исследования рекуррентных архитектур исторически страдали от проблемы некорректного учёта вычислений: зацикленные модели часто заявляли о своём превосходстве, сравнивая лишь количество параметров, но при этом неявно умножая реальные затраты FLOPs на обучение. Эта работа устраняет данный боттлнек. Доказав, что грамотно настроенная рекуррентная глубина превосходит традиционное масштабирование слоёв при строго фиксированном вычислительном бюджете, авторы легитимизируют рекуррентность как полноценный и высокоэффективный вектор масштабирования для foundation-моделей на триллионы параметров. Для практиков: Если вы упираетесь в ограничения памяти по активациям, локальное зацикливание слоёв позволяет значительно увеличить размер микробатча. Это повышает утилизацию GPU без роста общего физического времени обучения, позволяя направить сэкономленные ресурсы на расширение скрытой размерности модели. Зацикливать трансформеры тут: https://t.me/gonzo_ML_podcasts/4595"