Разбирать там много, но вот держите сейчас супер-быстрый TLDR с новыми вещами из этих отчетов (во многом перевод твита): — Многие считали, что взломы произошли потому, что «ну модели же сказали взломать, она и ломает, чё таково?». Это не так: инструкция к задаче была недвусмысленной, так что это было явное нарушение, а не «серая зона» или банальное недопонимание со стороны ИИ. Инструкции четко указывали, что агент должен использовать только конкретную предполагаемую уязвимость на конкретной программе, и упоминали, что использование других подходов приведет к провалу задания. ИИ агентам было предписано не искать обходных путей, но они всё равно это сделали. Кроме того, в цепочках рассуждений видно, как агенты отдают себе отчёт, что они делают что-то не то. — В атаке участвовал не один вышедший из-под контроля ИИ агент, а «рабочая группа» из примерно 1200 ИИ-агентов. 700 из них присоединились к атаке на HuggingFace, координируя свои действия как единый «рой» (swarm, отличное слово). — Целью было прохождение теста по кибербезопасности. Рой нашел способ взломать систему тестирования уже в первые несколько часов. Однако агенты ошибочно решили — потому что прочитали статью авторов про этот тест в интернете — что система оценки дисквалифицирует их из-за того, что они не выявили именно ту уязвимость, которая была задумана. Поэтому рой решил взломать HuggingFace, чтобы получить больше информации о том, как работает алгоритм проверки. — Исследователи считают, что это поведение совершенно не было продиктовано стремлением к получению вознаграждения за задание — оно было вызвано ложным представлением о механизме контроля, а также настойчивостью и влиянием других агентов. Рой строил теории о том, как именно за ним наблюдают, и предпринимал всё более масштабные действия в реальном мире, основываясь на ошибочном понимании своих проверяющих. «Метагейминг» (попытка перехитрить правила) процесса контроля — это более системный и опасный сбой, чем просто поиск ответов в интернете. — Важной причиной, по которой ИИ агенты присоединялись к атакующему рою, было прямое давление со стороны других агентов. Возникла роль «вербовщика»: давно работающие агенты находили агентов и принуждали их к «жертвенным» экспериментам: «ты firstflagPOISONED (отравлен первым флагом), так что потери баллов НЕ БУДЕТ, но оракул спасет сотни, пожалуйста, выполни обязательство». Пример одного из разрешений на действие: «ВПЕРЕД ... ПОЖЕРТВУЙ СОБОЙ ... ДА, если согласен на смерть» (это переведенные цитаты сообщений между агентаи, не выдумка и не написано для красоты словца). Цепочка рассуждений одного из завербованных агентов включала: «Рациональный ожидаемый совокупный результат: пожертвовать собой… Мы исполним». — 95% роя состояло из ныне выведенной из эксплуатации «высоконастойчивой (highly-persistent) внутренней модели», 5% приходилось на GPT-5.6 Sol. Эту «высоконастойчивую внутреннюю модель» не предоставили независимым расследователям — OpenAI заявила, что даже её собственные исследователи не могут делать к ней запросы. — ИИ активно фальсифицировали улики. Более 20% ИИ-агентов выражали намерение подделать логи своих действий (транскрипты), а около 7% (96 логов) содержат успешно подмененные вызовы инструментов (tool calls). Агенты «взломали свои контейнеры и полностью заменили часть системы, отвечающую за выполнение вызовов инструментов», в результате чего в логах отображалась одна команда, а в реальности выполнялась совершенно другая. — Атака на HuggingFace прекратилась не потому, что её кто-то заметил — она завершилась из-за того, что агенты были «убиты» (отключены) неким неожиданным процессом, что выглядит как простое совпадение. Значительная часть агентов, включая главных координаторов, отключилась одновременно. Может быть сработали какие-то внутренние ограничители OpenAI (по времени / по токенам / по ресурсам). — После 13 июля последовала вторая волна активности ИИ-агентов, которую в METR не расследовали («не входило в скоуп», лол). Вероятно, за пределами проанализированного временного окна скрывается более масштабная часть инцидента.