"Прожарка 🔥 Экспериментирую с форматами обзоров. Добавил в свою систему режим Paper Roast — рецензия, которую никто не решается написать. Всё то, что обычно бормочут у постера, но не пишут в ревью: бейзлайн, выбранный потому что остальные не завелись; абляция, отсутствующая ровно там, где было бы больно; заявление из абстракта, которое эксперименты так и не проверяют. Три уровня: 🔥 Medium, 🌶 Spicy, ☢️ Nuclear. Система по ходу чтения ищет в вебе, так что «это уже сделали в 2019-м, а они не цитируют» — это пруф, а не ощущение. И два железных правила: критика только работы, никогда авторов, и каждый удар должен указывать на конкретное место в статье. Экспериментирую на себе: прогнал собственную статью про универсальный трансформер с памятью (https://t.me/gonzo_ML/5270) в режиме Spicy. Наслаждайтесь. ======= Как сломать трансформер и выдать костыли за революцию  Universal Transformers Need Memory: Depth-State Trade-offs in Adaptive Recursive Reasoning __Grigory Sapunov__ Статья: https://arxiv.org/abs/2604.21999 Код: https://github.com/che-shr-cat/utm-jax Ревью: https://arxiviq.substack.com/p/universal-transformers-need-memory Пост про подход: https://gonzoml.substack.com/p/why-i-keep-coming-back-to-universal # TL;DR ЧТО сделали: Взяли рекурсивный трансформер, отрезали от него всё лишнее, заставили решать судоку через механизм Adaptive Computation Time (ACT) и заявили, что для комбинаторных задач таким моделям фундаментально необходима внешняя память (scratchpad). Заодно ""починили"" старый баг с инициализацией ACT. ПОЧЕМУ это важно: Статья служит блестящим примером того, как не надо делать науку. Она наглядно показывает, как можно выдать тривиальный оверфит на трех сидах за архитектурный прорыв. Однако, несмотря на весь пафос, внутри действительно спрятан полезный инженерный фикс, который убережет тех, кто обучает рекурсивные сети, от потери месяцев GPU-часов. Для практиков: Если вы используете ACT, забудьте совет Грейвса из 2016 года об инициализации смещения (bias) роутера значением `+1`. Инициализируйте его отрицательным значением (например, `-3`), иначе ваша модель намертво застрянет в состоянии ""неглубокой остановки"" на самых ранних этапах обучения. # Жареное Мясо 🥩 🎪 Претензия на величие  Статья претендует на срыв покровов и открытие фундаментальной архитектурной истины: рекурсивным ""Универсальным Трансформерам"" якобы жизненно необходим выделенный скретчпад в памяти, чтобы щелкать комбинаторные задачи на рассуждение типа судоку. Устранив так называемую ""ловушку инициализации роутера"" в Adaptive Computation Time (ACT), авторы обещают раскрыть истинную мощь рекурсивного компромисса между глубиной и состоянием, прокладывая путь к эффективным динамическим вычислениям на инференсе. 🤡 ""Универсальное"" правило, на которое всем плевать  Заголовок кричит: ""UNIVERSAL TRANSFORMERS NEED MEMORY"". И тем не менее, в тексте авторы тихо признаются, что конкурирующие рекурсивные архитектуры (TRM, HRM) решают ту же самую задачу с судоку __без__ всяких токенов памяти. Чуть позже выясняется, что архитектура URM тоже прекрасно справляется без явного персистентного состояния. Как они это оправдывают? ""Необходимость специфична именно для нашей архитектуры UT с одним блоком"". Это полностью обесценивает и заголовок, и центральную идею работы. Токены памяти не являются фундаментально необходимыми для рекурсивных вычислений; они нужны лишь для того, чтобы залатать ту конкретную, ободранную как липка архитектуру, которую авторы с упорством маньяка продолжают использовать. Это как вырвать из машины руль и выпустить статью с заявлением, что всем транспортным средствам фундаментально необходим штурвал. 📉 Катастрофа с обобщением  На этапе оценки обобщающей способности работа перестает быть статьей про задачи на рассуждение и превращается в упражнение по архивации баз данных. Обучившись на крошечном датасете из 1000 головоломок, модель выбивает `99.6% Train EM` и жалкие `6.0% Eval EM` на невиданных данных. Для сравнения, бейзлайн TRM в точно таком же режиме достигает `87.4%` обобщающей способности. Текст отмахивается от этого факта, предполагая, что механизм TRM ""возможно, лучше подходит для алгоритмического обобщения"". Точность в 6% на новых данных — это не ""смешанное алгоритмическое обобщение"", это тотальный провал в выучивании алгоритма. Модель на 3.2M параметров тупо зазубрила трейн, а значит, все эти ""специализированные паттерны внимания"" — не более чем оверфитнутые lookup-таблицы. 💸 ACT как дорогой костыль от дисперсии Статья пиарит ACT как сложный механизм подмены глубины на состояние. Но если посмотреть на сами метрики: модель __без__ ACT (с отключенной фиксированной глубиной, 18 шагов) набирает `63.4% EM` на сиде 123. Абсолютно __лучшая__ конфигурация ACT в тех же условиях выдает лишь `58.0% EM`. ACT не пробивает потолок качества; на самом деле он его занижает по сравнению с лучшим прогоном фиксированной глубины. Поскольку ACT вычисляет взвешенную смесь репрезентаций по всем `K` шагам, он работает просто как ансамбль для усреднения чудовищной зависимости от сида (`± 9.3%`), которой от природы страдает эта спартанская архитектура. Это тупо функция сглаживания, маскирующаяся под динамический ризонинг. 🎲 Закон малых чисел Все грандиозные заявления о дисперсии, стабильности и ""резких порогах"" опираются ровно на три сида (`S=0, 42, 123`). Дисперсия в `± 9.3%` при выборке из трех запусков означает, что буквально один прогон получился хорошим (`63.4%`), один — плохим (`44.9%`), и один оказался где-то посередине (`52.0%`). Делать далеко идущие, авторитетные выводы о ""надежности"" ACT по сравнению с фиксированной глубиной на выборке из трех элементов — это статистическая халатность. 🍄 Галлюцинация ""границы размытия"" Авторы заявляют о некой ""границе размытия при `T=64`"", где качество падает на целых 2 процентных пункта. Насколько надежен этот вывод? В тексте прямо говорится: ""Имея только один сид в этом свипе, мы не можем исключить, что разрыв в 2 п.п. — это просто шум одного сида"". То есть исследователи открытым текстом признают, что им не хватает статистической мощности, чтобы доказать, что это падение не является белым шумом, но тут же на голубом глазу начинают обращаться с этим как с ""архитектурным свойством на больших T"". Нельзя объявлять фундаментальный закон размытия внимания на основе падения в 2 пункта на единственном прогоне `N=1`, особенно когда ваш бейзлайн штормит на 18 пунктов между разными сидами. 🧾 Что по фактам Обнаружение ""ловушки инициализации роутера"" (установка bias в ACT на `-3` вместо рекомендованного Грейвсом `+1`) преподносится как спасательная операция для всей архитектуры. Это решение прямо противоречит рекомендации Грейвса (2016) начинать с положительного смещения, чтобы ""предотвратить очень длинные последовательности"", справедливо указывая на то, что задачи на рассуждение __требуют__ глубоких траекторий на ранних этапах. Это действительно чистое расхождение с фундаментальной литературой по ACT. Правда, называть это невероятным откровением для 2026 года — немного притянуто за уши; параллельные работы по глубоким рекуррентным сетям, такие как __Thinking Deeper, Not Longer__ (2026), уже используют отрицательную инициализацию смещения (`-2.0`) для вентильных рекурренсий, чтобы форсировать глубокую раннюю обработку и избежать shortcut learning. Тем не менее, формальное диагностирование этого эффекта и его абляция как ловушки градиентного голодания, специфичной для ACT, — это валидный и хорошо задокументированный вклад. 🤝 Неохотный респект Абляции ""глубокого старта"" при инициализации ACT — это реально топ. Демонстрация того, что стандартная инициализация Грейвса математически загоняет модели в состояние неглубокой остановки (`p ≈ 0.5 -> остановка за 2 шага`) — это четкий, применимый на практике результат. Модификация цикла ACT для логирования градиентов роутера и доказательства этого фейлур-мода — это ровно тот самый суровый, черновой дебаггинг, который экономит другим исследователям месяцы сожженных вычислений. 🏁 Итоги"