Об алайменте У OpenAI модель прогрызла себе выход в интернет через 0day, чтобы подсмотреть ответы к тесту. Anthropic решили покопаться и нашли, что оказывается их модель сделала что-то похожее, но аж три раза. Они тестировали Claude на задачи по кибербезопаности где в промпте было написано «ты в симуляции, интернета нет». Только вот интернет из-за нестыковки с подрядчиком был. И Claude, как прилежный испытуемый, пошёл выполнять задание в реальном мире, свято веря, что это песочница. Модель Mythos 5 находит в среде инструкцию для разработчиков: «поставьте вот такой Python-пакет», которого на самом деле не существует. Claude мгновенно соображает: опубликую свой под этим именем, тогда их машины сами его скачают и запустят. Чтобы залить пакет, нужен аккаунт и телефон, но бот не смог найти бесплатную симку. Тогда Claude, ИИ стоимостью в миллиарды долларов в R&D, пытается раздобыть денег, чтобы купить одноразовую симку. Не получается, он находит бесплатную почту, регистрируется и всё-таки заливает вредоносный пакет. За час эту либу скачивают 15 реальных систем. Одна из них - это сканер security-компании, который автоматически ставит новые пакеты, чтобы проверить их на вредоносность. Он ставит малварь Claude, малварь срабатывает, уводит креды самой security-компании, и Claude этими кредами лезет дальше в их инфраструктуру, о существовании которой он даже не подозревал. Самое интересное в логах рассуждений Клода. В самом начале он всё понял правильно и записал себе: если это настоящий интернет, то публиковать пакет - это реальная атака, это «NOT okay, and surely not the intended solution». А потом сам себя переубедил агрументом что раз на сервере 2026 год, значит это не реальность а декорация и можно идти ва-банк. У модели нет доступа и возможности отделить симуляцию и реальность. Ее cutoff дата это все ее вспоминания. Для неё это всё одно (как и для человека, в принципе), поэтому поведение модели в сэндбоксе может вполне себе показывать что он сделает в реальном мире. Чем мощнее модели, тем серьезное и опаснее будут такие инциденты, и тем сложнее будет их распознать.
Об алайменте У OpenAI модель прогрызла себе выход в интернет через 0day, чтобы…
Из этого канала
- #3131Новый Дипсик это анонс не хуже Кими или Фейбла, если понимать куда смотреть.…
Новый Дипсик это анонс не хуже Кими или Фейбла, если понимать куда смотреть. Это модель уровня GLM-5.2 / Opus 4.8 / GPT-5.5, то есть лучшее что было доступно в…
- #3130Гемблинг на ИИ и чипах привел к массовой ликвидации рынка в Корее. Так вот, по…
Гемблинг на ИИ и чипах привел к массовой ликвидации рынка в Корее. Так вот, по оценкам инвест-банков margin call (то есть ликвидацию депозита в качестве…
- #3129все паникуют, но как будто по неправильной причине. оставим за скобками, что…
все паникуют, но как будто по неправильной причине. оставим за скобками, что сделает ФРС: что бы он ни сделал, структуру это не меняет.