Разбор статьи постараюсь сделать попозже, а пока мысли по новости: 1) идея применять один и тот же слой или набор слоёв несколько раз подряд давно обсуждалась, но до сих пор не было известно ни про одну полноценную модель с его применением 2) OpenAI известны тем, что они берут простые идеи и доводят их до результата; именно это позволяло им из раза в раз делать прорыв и находить путь вперёд, в то время как другие просто следовали 3) если Astra и вправду новое архитектурное открытие, которое ещё никто не применил (хотя ходили слухи, как я считаю абсолютно безосновательные, что последние модели Anthropic могут быть рекуррентными) — в ближайшие полгода-год нас ждёт очередной виток ускорения улучшения моделей. 4) в новостной заметке, как мне кажется, много путаницы по поводу того, что именно «скрыто». Сама цепочка рассуждений остаётся, но теперь между одним токеном и вторым появляется больше вычислений. Само по себе обычное увеличение модели даже без всякий рекурсии приводит к тому же — модель формирует множество промежуточных представлений, чуть-чуть меняет/уточняет их и затем генерирует токен 5) кажется что это не так страшно, как если бы модель переходила с текста на рассуждения в векторах/эмбеддингах, когда рассуждения не формализуются вовсе, и читать нечего. Я не вижу, почему это должно быть хуже с точки зрения мониторинга рассуждений, чем обучение модели с бОльшим количеством слоёв — только тут получается ещё меньше параметров, что скорее не ухудшает мониторинг рассуждений и их честность. Ждём китайцев с залупливанием слоёв 🍿 UPD: добавка от главреда TheInformation Похоже, возникло недопонимание относительно статьи и того, чем занимается OpenAI. В передовых лабораториях разрабатываются новые методы, включающие в себя реккурентные трансформеры и тому подобное. Как мы отмечаем в статье, OpenAI устанавливает ограничения на использование циклов рекурсии и пытается обеспечить видимость/мониторинг рассуждений в Astra. Опасение вызывает то, что другие разработчики ИИ могут не придерживаться таких ограничений.
Разбор статьи постараюсь сделать попозже, а пока мысли по новости: 1) идея…
Из этого канала
- #3897Комментарий Ryan Greenblatt, исследователя, принимавшего участие в…
Комментарий Ryan Greenblatt, исследователя, принимавшего участие в расследовании инцидента со взломом HuggingFace: Сообщается, что новейший ИИ от OpenAI,…
- #3895Проснулись потянулись, снова новости про Astra 👨🦳 TheInformation получили…
Проснулись потянулись, снова новости про Astra 👨🦳 TheInformation получили доступ к очень интересной информации об архитектуре модели, ниже — перевод выбранных…
- #3893OpenAI тоже решили выпустить... блогпост про то, как они идут к релизу Astra…
OpenAI тоже решили выпустить... блогпост про то, как они идут к релизу Astra (который состоится «скоро»).
- #3889Вышел Claude: Fable 5.1. Помимо увеличения метрик (на паре свежих и/или…
Вышел Claude: Fable 5.1. Помимо увеличения метрик (на паре свежих и/или закрытых бенчмарков — существенного, см.