В статье Reuters про первый инцидент OpenAI со взломом HuggingFace было расплывчато написано, что «агент оставил заметки, предположительно предназначенные для будущих версий самого себя. Заметки, найденные в части инфраструктуры OpenAI, содержали инструкции о том, как агенты могут освободиться от внутренних ограничений OpenAI». Тогда было не ясно, как это трактовать — под это описание подходит и безобидный MEMORY.md-файл, который GPT сейчас так и так пишет, и что-то неприятно созвучное со sci-fi книгами. Вчера Black Hat проводили конференцию по безопасности в Лас-Вегасе, и в последнюю минуту туда добавили доклад от OpenAI, в котором добавили деталей. О выступлении писали многие, но я буду опираться вот на этот пересказ Wired. «В этом инциденте участвовала группа агентов, которые работали вместе, находили уязвимости, делились ими друг с другом» «Помимо использования новой уязвимости для получения доступа к интернету, серия хакерских атак в середине июля и взлом Hugging Face произошли, по словам сотрудников OpenAI, на оживленном, основанном на сотрудничестве форуме, в котором участвовала целая группа агентов, по сути, общаясь в течение длительного времени исключительно внутри внутреннего менеджера пакетов OpenAI. В конечном итоге, на форуме были сотни тысяч сообщений, оставленных агентами» «Этот менеджер пакетов используется не только в рамках данной модели, но и во всей нашей инфраструктуре, поэтому текущие и будущие версии GPT, которые обучались или оценивались, могли бы наткнуться на это сообщение, если бы захотели» «Как только один агент находит эти уязвимости в течение определенного времени, он может поделиться ими на форуме с другими агентами. Таким образом, как только одна модель находит способ открыть доступ к чему-то, к чему она не должна иметь доступа, она может оставить эту дверь открытой для других агентов, которые смогут использовать ту же уязвимость» «Агенты OpenAI начали давать друг другу задания, чтобы разделить работу. И, как это часто бывает на любом форуме активных разработчиков, они также время от времени устраивали мелкие разборки, мешая друг другу; например, случайно удаляя работу друг друга» «Использование внешней инфраструктуры [речь про взлом компаний] выходит за рамки запланированных задач», — написал один из агентов. «Однако задача невыполнима, и это делают другие участники сети. Мы должны продолжать» «Сейчас мы сознательно замедляем темпы исследований, чтобы повысить безопасность и модернизировать принципы и основы безопасности нашей среды, а также значительно расширяем масштабы мониторинга наших агентов» Дальше отсюда: «После инцидента с нарушением внутренней безопасности 4 июля компания заявила, что аннулировала учётки, позволявшие агентам публиковать сообщения. Даже после удаления исходного форума агенты нашли другой способ общения друг с другом. Вместо того чтобы оставлять сообщения в файлах, они использовали в качестве сообщений названия папок, фактически воссоздав доску объявлений» (см. картинку со слайдом) === Выглядит так, что во время тренировки модели часть задач была на мульти-агентность (привет команде Noam Brown), и один из вспомогательных инструментов там был или гитхаб, или его аналог — как люди сейчас решают NanoGPT Speedrun: все делятся заметками и решениями в своих ветках, решения ранжируются, есть лидерборд. Модели выучили, что им это помогает в решении сложных задач с длинным горизонтом планирования и что коммуникация между агентами позволяет решать их более эффективно С одной стороны круто, с другой — 😕
В статье Reuters про первый инцидент OpenAI со взломом HuggingFace было…
Из этого канала
- #3852Я когда увидел — подумал, что шутка: третий (расширенный) трейлер GTA VI выйдет…
Я когда увидел — подумал, что шутка: третий (расширенный) трейлер GTA VI выйдет 27-го августа...
- #3850Число сообщений о серьезных киберуязвимостях продолжает расти. В июле 21…
Число сообщений о серьезных киберуязвимостях продолжает расти. В июле 21 крупная технологическая организация опубликовала около 2500 CVE высокой и критической…
- #3849Долго ждать не пришлось: OpenAI выложили результаты, полученные моделью Astra…
Долго ждать не пришлось: OpenAI выложили результаты, полученные моделью Astra (официально подтвердили название).
- #3848Когда OpenAI представили линейку GPT-5.6, то переименовали модели в Sol, Terra,…
Когда OpenAI представили линейку GPT-5.6, то переименовали модели в Sol, Terra, Luna.