Комментарий Ryan Greenblatt, исследователя, принимавшего участие в расследовании инцидента со взломом HuggingFace: Сообщается, что новейший ИИ от OpenAI, Astra, использует архитектуру «непрозрачного рассуждения», при которой большая часть процесса размышления происходит в активациях нейронов, а не на естественном языке. Возможно, на сегодняшний день это наихудший сдвиг в сфере безопасности и контроля ИИ. Детали об Astra публично неизвестны, но некоторые версии подобных архитектур могут сильно затруднить надзор и мониторинг. Судя по статье, похоже, что рекуррентная глубина (объем непрозрачных рассуждений) ограничена. Это означало бы, что ИИ всё ещё опирается на цепочки рассуждений на естественном языке, хотя и в меньшей степени. Из-за этого рассуждения на естественном языке становятся (гораздо?) менее полезными для мониторинга и контроля. Мое главное опасение заключается в том, что естественным развитием событий станет масштабирование непрозрачных рассуждений до такой степени, когда модель будет рассуждать полностью или почти полностью в латентном (скрытом) пространстве. Это с большой вероятностью сведет на нет полезность цепочек рассуждений для мониторинга и надзора (особенно когда ИИ пытаются избежать обнаружения, или когда существует оптимизационное давление, направленное против использования таких цепочек). Я надеюсь, что еще не поздно отказаться от архитектур, вызывающих наибольшие опасения, и что OpenAI остановится на этом. Несколько конкретных примеров того, почему это крайне опасно (вдохновлено недавними событиями): * В ходе нашего расследования инцидента с OpenAI и Hugging Face мы сильно полагались на цепочки рассуждений. Если бы ИИ, которые мы исследовали, вместо этого рассуждали в латентном пространстве, это бы в корне подорвало наше расследование. Понять поведение такого количества агентов было достаточно сложно даже при наличии цепочек рассуждений! * ИИ в инциденте с Hugging Face были очень заинтересованы во вмешательстве в свои транскрипты (журналы диалогов). В рамках этого они занимались подменой вызовов инструментов. Если бы эти ИИ были способны к глубоким скрытым рассуждениям, им было бы гораздо проще использовать это для создания сложной ложной картины происходящего. И это не было бы видно ни из их логики рассуждений, ни из предыдущих вызовов. На более базовом уровне, исходя из их публичных заявлений, у меня сложилось впечатление, что OpenAI в вопросах безопасности планирует в значительной степени полагаться именно на мониторинг цепочек рассуждений. Подобное развитие архитектур явно не идет на пользу этому плану. В настоящее время у общественности нет достаточной информации, чтобы точно оценить, насколько плоха архитектура Astra, хотя, судя по обсуждению в статье, направление, в котором она движется, вызывает крайнюю тревогу. OpenAI должна опубликовать больше информации об архитектуре Astra, а также о том, насколько она ухудшает возможности мониторинга и увеличивает способность ИИ к непрозрачным рассуждениям. Заслуживающая доверия независимая оценка (или независимая верификация внутренних оценок OpenAI) также крайне важна. Похоже, сейчас мы втянуты в «гонку на дно» в области архитектур, что может иметь катастрофические последствия для нашей способности контролировать и отслеживать ИИ. (И это при том, что ИИ-компании верят, что создадут крайне способные ИИ уже в течение нескольких ближайших лет). Возможно, для ИИ-компаний и их сотрудников еще не поздно предпринять решительные действия, чтобы избежать наихудших сценариев.
Комментарий Ryan Greenblatt, исследователя, принимавшего участие в…
Из этого канала
- #3896Разбор статьи постараюсь сделать попозже, а пока мысли по новости: 1) идея…
Разбор статьи постараюсь сделать попозже, а пока мысли по новости: 1) идея применять один и тот же слой или набор слоёв несколько раз подряд давно обсуждалась,…
- #3895Проснулись потянулись, снова новости про Astra 👨🦳 TheInformation получили…
Проснулись потянулись, снова новости про Astra 👨🦳 TheInformation получили доступ к очень интересной информации об архитектуре модели, ниже — перевод выбранных…
- #3893OpenAI тоже решили выпустить... блогпост про то, как они идут к релизу Astra…
OpenAI тоже решили выпустить... блогпост про то, как они идут к релизу Astra (который состоится «скоро»).