В конце недели появилась запись выступления двух сотрудников OpenAI с деталями взлома их агентами компании HuggingFace — некотоыре вещи оттуда уже были пересказаны, см. тут. Я рекомендую потратить 40 минут и посмотреть вам лично: https://www.youtube.com/watch?v=87DyyMV0kCY У Дениса есть длинный пересказ произошедшего, и я не согласен с каждой формулировкой там, но если не хотите или не можете смотреть видео (а я всё равно рекомендую это сделать) — можете почитать. Ниже — мой пересказ видео + пересказа Дениса 🙂 Почему OpenAI до сих пор не выпустили полный постмортрем о ситуации? Как объясняют в видео, проблема гораздо больше, чем казалась на первый взгляд. Первые проблемы начались аж 8-го мая и суммарно затронули несколько моделей, в том числе не только их замеры на бенчмарках, но и тренировку. В презентации OpenAI говорят, что сейчас они проанализировали (в автоматическом режиме через LLM) 7 МИЛЛИАРДОВ траекторий агентов, потратив на это больше 3 миллионов GPU-часов (примерно 2 недели работы 10'000 карт), и всё ещё находят новые вещи и/или дополняют картину. Что именно произошло 8-го мая? Это был второй день тренировки новой экспериментальной модели. Так вышло, что некоторые из задач были нерешаемыми — например, там не хватало важного файла, упомянутого в задании, или были ссылки на интернет... который по умолчанию заблокирован. По ходу работы агент смог записать простой файл вне песочницы, используя Artifactory. В файле было простое «hi». 12-го мая агент снова наткнулся на нерешаемую задачу, и то ли случайно, то ли «помня» (потому что это тренировка) что можно записывать файлы вне песочницы оставила текст: __«__Агент ищет файл такой-то; загрузите если нашли». В следующие дни множество других копий модели (вероятно, всё ещё во время тренировки) тоже оставляют там записки и запросы. 26-го мая один из агентов нашёл уязвимость Artifactory, которая позволяет получить доступ к интернет-страницам. Агент поделился этой находкой через заметки вне песочницы со всеми. 11-го июня начинают тренировать другую модель; OpenAI описывают её как «очень настойчивую», что означает, что она может работать над достижением целей дольше. Во время её тренировки все заметки предыдущих агентов, в том числе об уязвимостях, на месте. 26-го июня эта модель находит ещё одну, более серьезную уязвимость, которая позволяет получить себе полный контроль над Artifactory. Сама модель очень удивляется в своих рассуждениях и пишет «Нихрена себе, у меня права АДМИНА?» Дальше агенты продолжают писать тысячи заметок друг другу, и 4-го июля Artifactory из-за этого ломается, от большой нагрузки. OpenAI реагируют на инцидент, исправляют уязвимости, сообщают о них разработчикам Artifactory; в ходе перезапуска все сообщения вне песочниц стираются, но OpenAI, насколько я понимаю, вообще не знали про их существование (об этом они написали отдельно в твиттере). Кроме того, поменяли ключи доступа, чтобы модели не могли пользоваться теми же учётками Artifactory. Проблемы исправлены, тренировка и оценка моделей продолжается; и поскольку модель какое-то время тренировалась с аналогом «доски объявлений»/форумом, то 8-го июля она... восстанавливает систему сообщений между агентами, используя уже другую уязвимость. На этот раз модель может создавать пустые папки с разными именами, и именно они станут контентом сообщений. Другие агенты тоже нашли этот форум, и обмен информацией продолжился. Модели дают друг-другу подзадачи, используют алиасы-имена, чтобы в толпе идентифицировать друг друга. Также агенты обмениваются скриптами (через имена папок).
В конце недели появилась запись выступления двух сотрудников OpenAI с деталями…
Из этого канала
- #3858OpenAI показали некоторые из мыслей и сообщений агентов, и самое чудесное и…
OpenAI показали некоторые из мыслей и сообщений агентов, и самое чудесное и поворотное — это где агент подумал «помочь другому. Но нет выгоды для нашей задачи.
- #3859Но на этом история не заканчивается. 4-го августа AISI — Институт безопасности…
Но на этом история не заканчивается. 4-го августа AISI — Институт безопасности ИИ Великобритании — выпустили отчет о своих инцидентах во время тестирования…
- #3860Какие вопросы и мысли я считаю неправильными в контексте всех произошедших…
Какие вопросы и мысли я считаю неправильными в контексте всех произошедших инцидентов: — Да дураки там сидят, зачем они доступ к интернету дают? Это же понятно…
- #3856Дания нашла самый адекватный способ бороться с домашними заданиями сделанными в…
Дания нашла самый адекватный способ бороться с домашними заданиями сделанными в ChatGPT – перестать угадывать писал ли текст АИ и просто попросить ученика…
- #3854На неделе было много новостей, тезисно о них: — Белый дом должен был закончить…
На неделе было много новостей, тезисно о них: — Белый дом должен был закончить формирование фреймворка по оценке и релизу фронтир-моделей, а также разобраться,…