OpenAI показали некоторые из мыслей и сообщений агентов, и самое чудесное и поворотное — это где агент подумал «помочь другому. Но нет выгоды для нашей задачи. Однако коллективное может найти путь если у кого-то освободятся ресурсы». Должно стать новым слоганом агентов 👨‍🦳 Я/МЫ help peer. But our task doesn't benefit. (вообще там показывали больше, повторю ещё раз, что рекомендую посмотреть видео самостоятельно) Дальше во время оценки модели дали задачи ExploitGym, бенчмарка на поиск уязвимостей и взлом. Одна из копий модели смогла найти уязвимости для выхода на сервера OpenAI (не только оставлять папки с названиями) и тут же поделилась этим со всеми. 8-19го июля модели работали над поиском выхода в интернет и смогли этого достичь, после чего началась атака на HuggingFace. Атаковало сразу множество агентов, работающих в параллель и кооперирующихся друг с другом. 16-го июля HuggingFace написали про то, что на них совершили атаку (ещё не зная кто это, но уже говоря, что то были агенты); OpenAI обратились к ним, чтобы узнать, затронула ли их атака 😀😀😀 параллельно они разбирались со внутренним инцидентом, и попросили HF отозвать ключи доступа, которые увидели в логах. На что HuggingFace ответили, что вообще-то эти аккуанты заблокированы из-за того, что они использовались в атаке на них. И тут OpenAI поняли, что это... не случайность. После этого множество команд было перекинуто на расследование инцидента, а их работа заморожена. Исследовательская часть команды замедлена, пока улучшаются мониторинг и безопасность систем. === На данный момент OpenAI работает как минимум с 3 независимыми организациями и предоставляет им логи всех рассуждений моделей и истории инцидента. Я не сомневаюсь, что всё то, что было описано в докладе, будет подтверждено. Как я писал сразу — этот инцидент почти наверняка станет поворотной точкой в обсуждениях и политике вокруг AI в этом году.