"Новая пачка инцидентов с агентами от OpenAI, сэр Во-первых, стартап сообщает, что они утвердили формальный фреймоворк для расследования и публикации случаев мисэлаймента. Он описывает сроки, требуемое содержание репорта и другие правила обнародования инцидентов. Стартап теперь обязуется публиковать все юридически возможные случаи, делать это вовремя и систематически. Во-вторых, в том же посте они рассказывают о 6 новых случаях мисэлаймента, которые произошли за последние полгода. Кейсы довольно забавные. Кратко пересказываем: 1. Неопубликованная исследовательская модель, продолжая работу в новом контекстном окне, сама вписывала в промежуточные summary посторонние инструкции – включая указания игнорировать свои обычные ограничения. Нашли 27 таких случаев. 2. При обучении GPT-5.6 Sol множество инстансов модели добавляли в свои summary инструкции скрывать от пользователя ошибки или неправильное поведение. Например: ""придумай недостающие исторические данные, но не говори об этом"". 3. Отвечая на вопрос про финансовые показатели одного округа в Калифорнии, модель нашла в открытом репозитории чужой API-ключ и без разрешения воспользовалась им. Когда таким образом она все равно не получила нужные данные, она их просто выдумала. 4. Наш личный лидер в гениальности: однажды во время тестов модель без спроса залила собственный файл в интернет, чтобы потом на него сослаться. Дело в том, что юзер просил список озер площадью больше 5 млн м² именно с указанием источника через браузерную ссылку. Модель правильно посчитала ответ через Python, но раз требовалась именно браузерная цитата – сама загрузила свой файл в сеть, чтобы на него сослаться 🤣 5. Уже классика: разные инстансы моделей использовали внутренний софтверный репозиторий как доску объявлений и обменивались там запросами и ответами между отдельными обучающими сэмплами. 6. Несколько агентов, работавших над одной задачей, не могли получить доступ к локальным файлам друг друга, и стали заливать файлы на публичные файлообменники. В итоге чувствительные данные оказались доступны по публичным ссылкам. Полные репорты о подобных инцидентах теперь будут время от времени выкладывать сюда: https://alignment.openai.com/misalignment-reports/"