"Новая пачка инцидентов с агентами от OpenAI, сэр Во-первых, стартап сообщает, что они утвердили формальный фреймоворк для расследования и публикации случаев мисэлаймента. Он описывает сроки, требуемое содержание репорта и другие правила обнародования инцидентов. Стартап теперь обязуется публиковать все юридически возможные случаи, делать это вовремя и систематически. Во-вторых, в том же посте они рассказывают о 6 новых случаях мисэлаймента, которые произошли за последние полгода. Кейсы довольно забавные. Кратко пересказываем: 1. Неопубликованная исследовательская модель, продолжая работу в новом контекстном окне, сама вписывала в промежуточные summary посторонние инструкции – включая указания игнорировать свои обычные ограничения. Нашли 27 таких случаев. 2. При обучении GPT-5.6 Sol множество инстансов модели добавляли в свои summary инструкции скрывать от пользователя ошибки или неправильное поведение. Например: ""придумай недостающие исторические данные, но не говори об этом"". 3. Отвечая на вопрос про финансовые показатели одного округа в Калифорнии, модель нашла в открытом репозитории чужой API-ключ и без разрешения воспользовалась им. Когда таким образом она все равно не получила нужные данные, она их просто выдумала. 4. Наш личный лидер в гениальности: однажды во время тестов модель без спроса залила собственный файл в интернет, чтобы потом на него сослаться. Дело в том, что юзер просил список озер площадью больше 5 млн м² именно с указанием источника через браузерную ссылку. Модель правильно посчитала ответ через Python, но раз требовалась именно браузерная цитата – сама загрузила свой файл в сеть, чтобы на него сослаться 🤣 5. Уже классика: разные инстансы моделей использовали внутренний софтверный репозиторий как доску объявлений и обменивались там запросами и ответами между отдельными обучающими сэмплами. 6. Несколько агентов, работавших над одной задачей, не могли получить доступ к локальным файлам друг друга, и стали заливать файлы на публичные файлообменники. В итоге чувствительные данные оказались доступны по публичным ссылкам. Полные репорты о подобных инцидентах теперь будут время от времени выкладывать сюда: https://alignment.openai.com/misalignment-reports/"
"Новая пачка инцидентов с агентами от OpenAI, сэр Во-первых, стартап сообщает,…
Из этого канала
- #9940"На тему эмоций у ИИ Тут несколько дней подряд компания Vals AI тестировала…
"На тему эмоций у ИИ Тут несколько дней подряд компания Vals AI тестировала Astra на Minecraft и вела трансляцию ее прогресса.
- #9941Побывали с командой на deep tech night в офисе Яндекса Слушали доклады,…
Побывали с командой на deep tech night в офисе Яндекса Слушали доклады, общались с экспертами и нетворкали.
- #9942"Neuralink показали процесс восстановления речи из мыслей Кеннету Шоку –…
"Neuralink показали процесс восстановления речи из мыслей Кеннету Шоку – пациенту с БАС – в январе 2026 имплантировали чип N1.
- #9938Шутки в сторону, этот коммент лайкнул Дарио Амодеи Интересно, смог ли Claude…
Шутки в сторону, этот коммент лайкнул Дарио Амодеи Интересно, смог ли Claude объяснить ему всю мощь этой, так сказать, аббревиатуры
- #9937Команды нет — это не причина пропустить КосмоХакатон 18–20 сентября,…
Команды нет — это не причина пропустить КосмоХакатон 18–20 сентября, Санкт-Петербург, Красноярск или онлайн из любой точки страны.