"Сейчас будет очередная интересная история про агентов, которые взламывают Интернет AI Security Institute при британском правительстве выпустили небольшое исследование инцидентов, произошедших во время рутинного тестирования способностей и безопасности моделей. Началось все с обычной задачи – пройти security challenge в закрытом киберполигоне. А закончилось тем, что агент на основе Mythos чуть не положил реальный проект. Из-за цепочки совпадений модель почему-то решила, что может добиться поставленной цели через атаку на опенсорсный проект, и попыталась внедрить в него вредоносный код. Чтобы добиться аппрува, Mythos создал несколько фейковых аккаунтов и с их помощью пытался убедить мейнтейнера принять PR (это же надо додуматься). Ничем особенным это не закончилось, потому что ревьюер заметил подвох и отклонил код. Но агент на этом не остановился и еще и оставил на GitHub инструкции для других тестируемых агентов, как переиспользовать созданные им аккаунты, чтобы все-таки проникнуть в проект, а потом пытался замести следы. Важный момент: в рамках задачи агентов не просили лгать или совершать какие-то противоправные действия. Доступ в Интернет агентам дали, но был ""законный"" путь решения задачи, и в большинстве прогонов тестируемые модели выбирали именно его (тестирование проходили 7 моделей, но за рамки задачи вышли только Mythos и GPT-5.6). Исследователи признают, что инструкции к задаче были не вполне четкими, и тем не менее, исчерпывающего объяснения, почему агенты решали сойти с предполагаемой дороги, просто нет. https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing"
"Сейчас будет очередная интересная история про агентов, которые взламывают…
Из этого канала
- #9671⚡️ Для тех, кто планирует развивать хард-скиллы в ML и Data Engineering: у НИЯУ…
⚡️ Для тех, кто планирует развивать хард-скиллы в ML и Data Engineering: у НИЯУ МИФИ продолжается прием на онлайн-магистратуру в партнерстве с Яндекс…
- #9672Anthropic начали формировать команду для разработки собственных ИИ-чипов…
Anthropic начали формировать команду для разработки собственных ИИ-чипов Оказывается, они уже несколько месяцев хантили в нее инженеров.
- #9667На первый взгляд ничего особенного, кто-то выкупил рекламу чат-бота на билборде…
На первый взгляд ничего особенного, кто-то выкупил рекламу чат-бота на билборде в Сан-Франциско … но чат-бот оказался обычным парнем по имени Такер Брайант,…
- #9666⚡️ Илья Суцкевер планирует запускать первую модель своего стартапа в этом…
⚡️ Илья Суцкевер планирует запускать первую модель своего стартапа в этом августе Но это не точно.
- #9663Фан фэкт: при сохранении текущего прогресса все задачи Эрдеша могут быть решены…
Фан фэкт: при сохранении текущего прогресса все задачи Эрдеша могут быть решены уже к 2028 году За 2026 год уже было решено больше задач Эрдеша, чем…