Разбор статьи постараюсь сделать попозже, а пока мысли по новости: 1) идея применять один и тот же слой или набор слоёв несколько раз подряд давно обсуждалась, но до сих пор не было известно ни про одну полноценную модель с его применением 2) OpenAI известны тем, что они берут простые идеи и доводят их до результата; именно это позволяло им из раза в раз делать прорыв и находить путь вперёд, в то время как другие просто следовали 3) если Astra и вправду новое архитектурное открытие, которое ещё никто не применил (хотя ходили слухи, как я считаю абсолютно безосновательные, что последние модели Anthropic могут быть рекуррентными) — в ближайшие полгода-год нас ждёт очередной виток ускорения улучшения моделей. 4) в новостной заметке, как мне кажется, много путаницы по поводу того, что именно «скрыто». Сама цепочка рассуждений остаётся, но теперь между одним токеном и вторым появляется больше вычислений. Само по себе обычное увеличение модели даже без всякий рекурсии приводит к тому же — модель формирует множество промежуточных представлений, чуть-чуть меняет/уточняет их и затем генерирует токен 5) кажется что это не так страшно, как если бы модель переходила с текста на рассуждения в векторах/эмбеддингах, когда рассуждения не формализуются вовсе, и читать нечего. Я не вижу, почему это должно быть хуже с точки зрения мониторинга рассуждений, чем обучение модели с бОльшим количеством слоёв — только тут получается ещё меньше параметров, что скорее не ухудшает мониторинг рассуждений и их честность. Ждём китайцев с залупливанием слоёв 🍿 UPD: добавка от главреда TheInformation Похоже, возникло недопонимание относительно статьи и того, чем занимается OpenAI. В передовых лабораториях разрабатываются новые методы, включающие в себя реккурентные трансформеры и тому подобное. Как мы отмечаем в статье, OpenAI устанавливает ограничения на использование циклов рекурсии и пытается обеспечить видимость/мониторинг рассуждений в Astra. Опасение вызывает то, что другие разработчики ИИ могут не придерживаться таких ограничений.