"Революционная и очень опасная архитектура новой Astra оказалась выдумкой журналистов ☕️ На днях по сети разлетелась громкая статья от The Information. В ней утверждалось, что в основе новой модели OpenAI под кодовым названием Astra лежит некая революционная архитектура «recurrent depth» или «looped transformer». Идея «looped transformer» в следующем: вместо того чтобы гонять фиксированный стек различных слоев ровно один раз, модель прогоняет скрытое состояние через один и тот же блок слоев несколько раз перед тем, как выдать следующий токен. Те, кто следит за ML-статьями, уже на этом моменте поняли, что никакой революции тут нет. Это довольно известный небольшой архитектурный трюк, который восходит корнями к работе Google ""Mixture-of-Recursions"" с NeurIPS. Мы разбирали ее здесь: https://t.me/data_secrets/7384. Эту идею уже много раз использовали в опенсорсе. Тем не менее, хайп статьи The Information почти достиг стратосферы. Дело в том, что помимо рассказов о революционной архитектуре, в тексте также утверждается, что looped transformer скрывает chain-of-thought. Точнее: в отличие от моделей, которые показывают рассуждения текстом, в looped transformer эти шаги скрыти внутри модели, и поэтому человеку недоступны. Так что новость почти сразу превратилась из архитектурной детали в спор о безопасности ИИ. OpenAI уже успели обвинить в том, что они переходят черту. Но на деле сам тезис про скрытые CoT оказывается очень спорным. Якуб Пахоцкий публично возразил, заявив, что репортаж вводит в заблуждение. А Себастьян Рашка написал про это вот так: Возможно, журналист The Information имел в виду какую-то другую технику или неверно понял, как работает looped transformer. Само по себе повторное использование слоев не подавляет видимый chain-of-thought, оно лишь добавляет вычисления в скрытых состояниях перед генерацией очередного токена, точно так же, как это делают обычные слои трансформера. Единственная правдоподобная связь, которую можно выделить: если модель делает больше таких рекуррентных проходов, ей может требоваться меньше промежуточных токенов-рассуждений. То есть больше вычислений происходит в латентных активациях, которые нельзя прочитать как текст. Но точно такой же эффект дало бы и простое увеличение размера модели – например, переход от GPT-5.6 Luna к GPT-5.6 Sol. Какой направшивается вывод, решайте сами"
"Революционная и очень опасная архитектура новой Astra оказалась выдумкой…
Из этого канала
- #9821Сегодня мы вышли из stealth! Про нас написали Wired (с заголовком these russian…
Сегодня мы вышли из stealth! Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии.
- #9822"Российские математики придумали модель, которая заняла первое место на ARC-AGI…
"Российские математики придумали модель, которая заняла первое место на ARC-AGI Небольшой стартап Mostik состоит из 15 человек, среди которых 12 PhD и…
- #9828В сентябре в России пройдет серия КосмоХакатонов 🚀 Шесть городов, 12+ задач от…
В сентябре в России пройдет серия КосмоХакатонов 🚀 Шесть городов, 12+ задач от компаний отрасли и общий призовой фонд 7,2 млн рублей.
- #9819Продолжаем следить за главными конференциями по машинному обучению. 19 сентября…
Продолжаем следить за главными конференциями по машинному обучению. 19 сентября команда Data Secrets поедет на Practical ML Conf, чтобы посмотреть всё вживую и…
- #9816Правительство США встало на сторону OpenAI в суде по иску об авторских правах…
Правительство США встало на сторону OpenAI в суде по иску об авторских правах NYT против OpenA Напоминаем, что New York Time судится с OpenAI и Microsoft с…