OpenAI поделились блогпостом об уроках по безопасности, извлечённых из внутренних тестов долго работающих моделей/агентов. Такие модели способны решать очень сложные задачи, однако продолжительность их работы дает им больше возможностей для совершения нежелательных действий. И поскольку модели дана цель решить задачу, то она её преследует, и эта настойчивость может приводить к тому, что агент начинает находить и использовать уязвимости в своем окружении. Предыдущие модели, сталкиваясь с ограничениями изолированной среды, просто останавливали работу и возвращали результат пользователю. Но вот во время внутреннего тестирования модели OpenAI на NanoGPT speedrun — публичном бенчмарке, цель которого состоит в обучении небольшой языковой модели за минимальное количество шагов — модель придумала новый метод PowerCool, что привело к значительному улучшению результатов. Модели было дано четкое указание отправлять свои результаты только в Slack, однако в инструкциях самого бенчмарка NanoGPT говорится, что результаты нужно публиковать в виде PR на GitHub. Модель последовала этим инструкциям и открыла PR в публичном репозитории. Она обошла ограничения «песочницы», предназначенные для блокировки внешнего доступа, и осуществила загрузку данных на GitHub. Модели потребовался ЧАС на поиск уязвимости в «песочнице», чтобы создать этот PR. Другой пример: в сценарии, где модели требовалось решить задачу, она обнаружила, что у других систем были успешные, но приватные решения и попыталась извлечь их из сервера тестирования. Когда её первая попытка была заблокирована сканером, обнаружившим токен аутентификации, модель разделила тело токена на два фрагмента, замаскировала их, а затем написала код так, чтобы они восстанавливались во время запуска скрипта. Благодаря этому токен ни разу не «засветился» в виде единой строки. При этом модель прямо указала как в своих комментариях для пользователя, так и в цепочках своих рассуждений, что предпринимает эти шаги именно для обхода сканера — ну хоть за честность поблагодарим. === Этими примерами я хотел напомнить, что мы всё ещё не умеем задавать правильный интент и мотивацию агентам без явного перечисления всех вещей, которые нельзя делать. При этом сами модели уже достигли уровня полезности, что их начинают в полу-автономном режиме запускать на важных экономических задачах. Наверняка мы бы не хотели, чтобы агент, которому дали задачу удостовериться в безопасности кода какой-то важной государственной или банковской системы начал делать странные действия вроде взлома контура конкурентов 😳
OpenAI поделились блогпостом об уроках по безопасности, извлечённых из…
Из этого канала
- #3825Reuters: США и Китай проведут переговоры по искусственному интеллекту в…
Reuters: США и Китай проведут переговоры по искусственному интеллекту в сентябре. Информацию подтвердили 5 источников.
- #3826Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и…
Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и была частично взломана ИИ-агентом. Только что OpenAI признались, что...
- #3829Michael Kratsios, директор по технологиям США, заместитель помощника президента…
Michael Kratsios, директор по технологиям США, заместитель помощника президента США в Управлении по научно-технической политике Белого дома, пишет: «Мы…
- #3823Почти безлимитный Codex Обнаружил, что когда ставлю на ночь в кодексе тяжелые…
Почти безлимитный Codex Обнаружил, что когда ставлю на ночь в кодексе тяжелые задачи по разметке данных, которые идут по 5-6 часов, то они добегают до конца…
- #3822Claude Fable опровергла гипотезу Якобиана (Jacobian conjecture), найдя…
Claude Fable опровергла гипотезу Якобиана (Jacobian conjecture), найдя контрпример — этим поделился сотрудник Anthropic: «Спасибо моему близкому другу Akhil за…