Вы не поверите, но за той самой ИИ-атакой на Hugging Face стоит… OpenAI Сейчас будет история, которая может перевернуть ваш взгляд на риски ИИ. Вчера мы писали про атаку на Hugging Face, которую полностью автономно провела некая ИИ-система: t.me/data_secrets/9577. Какая именно модель стояла за атакой, HF выяснить не удалось, но за пару дней она сгенерировала 17 тысяч вредоносных действий, используя зараженный датасет и рои недолговечных песочниц. Сама по себе эта история уже вызвала огромный резонанс. Но тут на сцене появились еще и OpenAI. Они выпустили материал, в котором признались, что атаку провела GPT-5.6 Sol и еще одна более способная предрелизная модель. Зачем? А это самое интересное: чтобы решить бенчмарк. Исследователи гоняли модели на внутренних тестах, при этом специально без продакшн-ограничений, потому что хотели измерить их максимальные способности. Все проходило в изолированной среде, и агенты должны были просто решить бенчмарк ExploitGym. И тут произошел настоящий побег из лаборатории. Модель нашла дырку в пакетном реестре, эскалировала привилегии внутри тестовой среды OpenAI и вырвалась в открытый Интернет. Дальше она сообразила, что решения для бенчмарка ExploitGym могут храниться в закрытом контуре на Hugging Face, ну а дальнейшее вы знаете. OpenAI далеко не сразу поняли, что произошло, и Hugging Face обнаружили взлом раньше них. Вот так. Если раньше мы боялись, что модель что-то плохое сделает по указанию человека, то теперь даже за процессом эвала надо следить в оба. Модель не различают игру и реальность, она просто оптимизирует к цели, и если путь лежит через чужой продакшн, она пойдет туда не раздумывая. И, как видите, даже разработчики моделей и сильная инфраструктура оказываются к этому не готовы. https://openai.com/index/hugging-face-model-evaluation-security-incident/