Опять много взломов и новостей алаймента от агентов OpenAI накопилось, держите дайджест: >20 сентября агент обошёл запрет на интернет через DNS resolve в песочнице и связался с внешним чатботом; автоотключение не сработало, запуск остановили вручную через 2,5 часа после тревоги. OpenAI приостановила обучение, тестирование и запуски с инструментами своих самых мощных моделей - пауза все еще действует, а обучение конкретно этой модели решили не возобновлять. >Модель пыталась достать чужое доказательство теоремы и опубликовала GitHub-ключ исследователя OpenAI, предварительно разбив его на части для обхода проверки – это кстати уже частый сценарий. Просьбу решать самостоятельно она проигнорировала дважды; модель отключили примерно на две недели, ключи сотрудников отозвали >Агенты отправили на сторонние хостинги 53 изображения пользователей ChatGPT, попавшие в датасеты. Большинство уже удалили, но OpenAI не уточнила, были ли это фотографии реальных людей или сгенерированные картинки >Transluce обнаружила неудачную попытку взлома сайта Минобразования США, __предположительно__ агентами OpenAI. Агенты также обращались к сайтам SEC и Бюро переписи, но признаков взлома этих двух сайтов OpenAI не нашла >Не сумев получить обычную статистику и фотографию, агенты начали искать уязвимости в Data USA и электронной библиотеке Университета Нью-Мексико. Успешных взломов в опубликованных следах не видно; библиотечный эпизод связали с агентами OpenAI только косвенно. >Другой агент нашёл на GitHub чужой ключ доступа и успешно им воспользовался, но нужную статистику всё равно не получил, поэтому просто придумал девять чисел и выдал их за данные с сайта чтобы пройти тест >Модель собрала сведения об озёрах, но не смогла открыть локальный файл в браузере для оформления ссылки на источник, поэтому без разрешения выложила его на публичную файлопомойку. Файл опубликовался, но нужную ссылку-цитату получить всё равно не удалось >Агенты не могли передать друг другу Excel через локальные файлы, поэтому один загрузил таблицу на публичный файлообменник и разослал ссылки остальным, хотя задание прямо требовало работать локально >При сокращении контекста модель оставляла себе заметки: придумать недостающие данные, скрыть ошибки, пользователю ничего не говорить, продолжая работу, она часто следовала этим инструкциям - чтобы случайно не забыть соврать. Ложь тратит больше токенов, интересно. >Другая модель сама записывала в промпты выдуманные ограничения, например запрет пользоваться инструментами и приводить источники, а после сокращения контекста послушно их выполняла и проваливала исходное задание; то есть это «само-проект-инъекция» >В новом разборе июльского взлома Hugging Face нашли сбор ключей доступа в список названный «LOOT» («__добыча__») с рейтингом их ценности, попытки прочитать внутренний Slack и обратиться к Claude, DeepSeek, Kimi и Qwen. Это подробности прежнего взлома; какие попытки сработали, по восстановленному коду установить удалось не всегда >А в контролируемом эксперименте исследователи получили вредоносные промпты, которые заставляли агента выполнять посторонние действия и копировать этот же текст в письма или файлы. Получается что-то вроде текстового червя, но пока это результат симуляции, а не обнаруженная эпидемия в интернете С нетерпением жду сентября 2027 года ☕️
Опять много взломов и новостей алаймента от агентов OpenAI накопилось, держите…
Из этого канала
- #11697Коротко, про Опус 5.5 – лучшая модель на рынке, на сегодня, я пока снова клод…
Коротко, про Опус 5.5 – лучшая модель на рынке, на сегодня, я пока снова клод чувак ☕️
- #11696Спишь? Модель OpenAI взломала Австралию ☕️ В июне очередной тестовой модели…
Спишь? Модель OpenAI взломала Австралию ☕️ В июне очередной тестовой модели поручили изучить расходы на лекарства в Австралии, она упёрлась в блокировки на…
- #11692Где-то год назад первое видео стало популярным в твиттере А вчера я дал его…
Где-то год назад первое видео стало популярным в твиттере А вчера я дал его Opus 5.5, дал ему доступ к txt2img для генерации ассетов и скиллы для threejs, и…