CEO Anthropic Dario Amodei выпустил мини-эссе «Нам нужно контролировать темп развития передовых ИИ-систем». С его основной идеей уже согласились CEO OpenAI и xAI. Выжимка: — Anthropic и раньше тратили много усилий на изучение и снижение рисков ИИ, информирование общества и продвижение регулирования — несмотря на обвинения в хайпе, «думерстве» и захвате отрасли через регуляции. — Но за последние несколько месяцев Dario пришёл к выводу, что этого уже недостаточно: меры безопасности могут просто не успевать за ростом возможностей моделей. Поэтому, по его мнению, нужно сознательно ограничивать скорость развития frontier-моделей, хотя даже при таком подходе прогресс всё равно будет очень быстрым. Причины две: — примерно с этого лета развитие ИИ резко ускорилось — прежде всего из-за того, что ИИ всё лучше помогает создавать следующее поколение ИИ. — инцидент со взломом Hugging Face агентами OpenAI. Dario опасается, что уже через 6–12 месяцев подобный рой агентов потенциально сможет создать устойчивый ботнет огромного масштаба и причинить ущерб на сотни миллиардов долларов. При этом «контроль темпа» не означает остановку обучения моделей. Идея в том, чтобы между скачками возможностей оставалось достаточно времени на alignment, safeguards и независимую проверку их эффективности. Он предлагает три последовательных шага. 1. Встроенные независимые оценщики Frontier-лаборатории должны дать внешним организациям вроде METR постоянный доступ почти на уровне сотрудников компании. Они смогут проверять не только готовые модели, но и сами процессы обучения и деплоя, соблюдение заявленных мер безопасности и внутренние инциденты. Это важно потому, что сейчас компании сами решают, что раскрывать публике. Независимые оценщики должны иметь возможность публично сообщать о рисках, инцидентах, качестве предоставленного им доступа и даже о случаях, когда компания попыталась вырезать из отчёта существенную информацию. Anthropic уже добровольно обязуется внедрить такую систему у себя. 2. Координация демократических стран Frontier-компании в демократических странах должны договориться об общих стандартах безопасности и ограничениях на неконтролируемую гонку возможностей. Поскольку законодательство движется медленнее ИИ, часть таких правил лаборатории могут принять добровольно ещё до появления законов. Но Amodei подчёркивает: замедляться нужно так, чтобы при этом не потерять технологическое преимущество демократических стран над авторитарными. Поэтому он предлагает: — не продавать Китаю мощные ИИ-чипы и оборудование для их производства и бороться с контрабандой и удалённым доступом к зарубежным GPU; — пресекать несанкционированную дистилляцию frontier-моделей компаниями из авторитарных стран; — сильнее защищать сами веса моделей от кражи. По его оценке, это может достаточно замедлить Китай, чтобы заметно увеличить преимущество США в следующие 3–5 лет — период, когда ИИ станет особенно важен геополитически. Это не уменьшит вероятность будущих договорённостей с Китаем, а наоборот увеличит переговорные рычаги демократических стран. 3. Глобальная координация Следующий уровень — соглашения уже между США и другими демократиями с одной стороны и авторитарными государствами с другой. Dario предлагает несколько возможных уровней: Уровень 1: запрет очевидно опасных применений ИИ — например, для создания биологического оружия. Уровень 2: обязательное тестирование frontier-моделей перед релизом на серьёзные риски в кибербезопасности, биологии и alignment. Уровень 3: своего рода «скоростной лимит» на recursive self-improvement (RSI). Главная логика всего эссе: современные модели уже дают огромное количество информации о том, как строить более сильный ИИ и что может пойти не так. Если контролируемое замедление даст хотя бы дополнительный год-два до появления систем критического уровня возможностей, это время можно использовать для решения проблем alignment и безопасности. И даже если формальных международных соглашений добиться не получится, Dario считает, что уже само изменение неформальных норм поведения frontier-лабораторий может существенно помочь.