Проснулись потянулись, снова новости про Astra 👨‍🦳 TheInformation получили доступ к очень интересной информации об архитектуре модели, ниже — перевод выбранных цитат из статьи: — В Astra применена новая архитектура, известная как «рекуррентная глубина» или «зацикленный трансформер», что позволяет ИИ-модели улучшать свои ответы за счет многократной обработки одного и того же текста. — Существующие ИИ-модели, прежде чем сгенерировать очередное слово в ответе, пропускают текст через фиксированное количество последовательных «слоев» (математических операций), из которых и состоит модель. При использовании рекуррентной глубины модель может в циклическом режиме прогонять текст через одни и те же слои множество раз, прежде чем выдать следующее слово. — По словам источника, знакомого с ходом разработки, подход в Astra аналогичен подходу из прошлогодней научной статьи, посвященной «скрытым рассуждениям». — Использование рекуррентной глубины может положительно сказаться не только на производительности, но и на финансовых затратах. Многократное пропускание запроса через один и тот же слой модели, по сути, позволяет компактной нейросети работать на уровне гораздо более крупной. — Однако инновационный метод, повысивший эффективность модели, также означает, что она и ей подобные будут скрывать большую часть своего «мышления». Из-за этого станет сложнее отслеживать признаки нежелательного поведения ИИ, как утверждает источник, знакомый с процессом разработки модели Astra. — Данный метод вызвал опасения как внутри OpenAI, так и во всей индустрии. В отличие от доступных на рынке моделей, которые перед выполнением задачи в текстовом виде демонстрируют, как именно они над ней «размышляют», новый метод частично или полностью скрывает процесс рассуждений ИИ aka «цепочка рассуждений». Это означает, что шаги, предпринимаемые моделью для решения задачи, человеку будет сложно прочитать или понять. — При работе над Astra компания OpenAI ограничила использование метода рекуррентной глубины, поэтому модель по-прежнему выдает читаемую цепочку рассуждений, а исследователи компании могут достаточно эффективно контролировать ход ее мыслей. — Главный научный сотрудник OpenAI Jakub Pachocki не стал комментировать применяемые компанией методы, но отметил, что «глубина» их передовых моделей, включая Astra, «отличается не более чем в два раза от GPT-4», которую OpenAI выпустила в 2023 году. — Исследователи как в OpenAI, так и за ее пределами, опасаются, что другие разработчики ИИ, применив эту технологию в своих моделях, могут не стать вводить подобные ограничения. — Год назад исследователи OpenAI присоединились к своим конкурентам из Anthropic и Google, опубликовав совместное заявление. В нем они утверждали, что мониторинг цепочек рассуждений является ценным инструментом, который индустрия должна совместными усилиями стремиться сохранить. Примечательно, что в этом заявлении упоминалась та самая научная статья с описанием метода «скрытых рассуждений», который очень похож на технологию, использованную OpenAI в этом году для модели Astra.