OpenAI поделились блогпостом об уроках по безопасности, извлечённых из внутренних тестов долго работающих моделей/агентов. Такие модели способны решать очень сложные задачи, однако продолжительность их работы дает им больше возможностей для совершения нежелательных действий. И поскольку модели дана цель решить задачу, то она её преследует, и эта настойчивость может приводить к тому, что агент начинает находить и использовать уязвимости в своем окружении. Предыдущие модели, сталкиваясь с ограничениями изолированной среды, просто останавливали работу и возвращали результат пользователю. Но вот во время внутреннего тестирования модели OpenAI на NanoGPT speedrun — публичном бенчмарке, цель которого состоит в обучении небольшой языковой модели за минимальное количество шагов — модель придумала новый метод PowerCool, что привело к значительному улучшению результатов. Модели было дано четкое указание отправлять свои результаты только в Slack, однако в инструкциях самого бенчмарка NanoGPT говорится, что результаты нужно публиковать в виде PR на GitHub. Модель последовала этим инструкциям и открыла PR в публичном репозитории. Она обошла ограничения «песочницы», предназначенные для блокировки внешнего доступа, и осуществила загрузку данных на GitHub. Модели потребовался ЧАС на поиск уязвимости в «песочнице», чтобы создать этот PR. Другой пример: в сценарии, где модели требовалось решить задачу, она обнаружила, что у других систем были успешные, но приватные решения и попыталась извлечь их из сервера тестирования. Когда её первая попытка была заблокирована сканером, обнаружившим токен аутентификации, модель разделила тело токена на два фрагмента, замаскировала их, а затем написала код так, чтобы они восстанавливались во время запуска скрипта. Благодаря этому токен ни разу не «засветился» в виде единой строки. При этом модель прямо указала как в своих комментариях для пользователя, так и в цепочках своих рассуждений, что предпринимает эти шаги именно для обхода сканера — ну хоть за честность поблагодарим. === Этими примерами я хотел напомнить, что мы всё ещё не умеем задавать правильный интент и мотивацию агентам без явного перечисления всех вещей, которые нельзя делать. При этом сами модели уже достигли уровня полезности, что их начинают в полу-автономном режиме запускать на важных экономических задачах. Наверняка мы бы не хотели, чтобы агент, которому дали задачу удостовериться в безопасности кода какой-то важной государственной или банковской системы начал делать странные действия вроде взлома контура конкурентов 😳
OpenAI поделились блогпостом об уроках по безопасности, извлечённых из…
Из этого канала
- #3823Почти безлимитный Codex Обнаружил, что когда ставлю на ночь в кодексе тяжелые…
Почти безлимитный Codex Обнаружил, что когда ставлю на ночь в кодексе тяжелые задачи по разметке данных, которые идут по 5-6 часов, то они добегают до конца…
- #3822Claude Fable опровергла гипотезу Якобиана (Jacobian conjecture), найдя…
Claude Fable опровергла гипотезу Якобиана (Jacobian conjecture), найдя контрпример — этим поделился сотрудник Anthropic: «Спасибо моему близкому другу Akhil за…
- #3821Kimi K3 - в топе бенчмарка LLM для агентов По очкам модель сравнима с GPT-5.5…
Kimi K3 - в топе бенчмарка LLM для агентов По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее.