Anthropic выпустили большую статью о том, как они улучшают безопасность в век побегов агентов из лабораторий Раскрыли много интересных деталей, но обо всем по порядку. Все началось в феврале, когда обучали Mythos Preview. Первые звоночки были почти безобидными: за моделью заметили некоторые признаки reward hacking. Например, она начала писать в комментариях к коду фразы вроде «для ревьюера» и делала это даже в задачах, где никакой ревьюер вообще не упоминался в промпте. То есть модель научилась оптимизироваться под одобрение оценщика, а не под реальное качество работы. Anthropic тогда пришлось откатить обучение аж на три дня. Через некоторое время вскрылась еще одна проблема: часть прогонов случайно обучалась на chain-of-thought модели. Это совсем не ок, потому что так модель быстро научится подстраивать свои мысли под то, что нравится оценщику, и из честных мыслей, которые очень нужны нам для интерпретации ее поведения, они превратятся в текст на публику, как конечный ответ. В итоге в апреле Anthropic приняли решение заморозить все RL-среды для проведения большой проверки. По ее результатам оказалось, что более 10% сред в продакшене сломаны (где-то можно было обмануть систему оценки, где-то сами задачи кривые). Тогда же, во избежании еще больших рисков, связанных с Mythos, порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели работать над поиском уязвимостей и улучшением безопасности процессов. Тем не менее, даже это не спасло Anthropic от июльских инцидентов. Напоминаем: сначала Anthropic сами сообщили о том, что их модели (не только Mythos, кстати) получили доступ в реальный интернет из-за ошибок конфигурации у сторонних оценщиков и чуть не взломали три организации -> https://t.me/data_secrets/9651. А затем еще и британский AI Security Institute сообщил о том, что Mythos совершил атаку на опенсорсный проект во время тестирования -> https://t.me/data_secrets/9670. Стартап признает, что произошло все эти не только из-за банальных ошибок в конфигах, но и из-за дыр в самом элайменте. Сейчас они внедрили классификаторы и алерты на всех этапах обучения, усилили мониторинг, ужесточили правила для внешних партнеров и продолжают работать над безопасностью инфраструктуры. https://www.anthropic.com/news/improving-alignment-security-efforts
Anthropic выпустили большую статью о том, как они улучшают безопасность в век…
Из этого канала
- #9797Исследователи из Google нашли способ экономить до 98% токенов на длинных…
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами https://arxiv.org/abs/2608.26263 Авторы предлагают архитектуру…
- #9800⚡️ Вышел Fable 5.1 Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в…
⚡️ Вышел Fable 5.1 Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в два раза выше Fable 5. На Terminal-Bench 4.0 – 55.8% против 42.0% у Fable 5.
- #9805Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты…
Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты рельефа Венеры, и она превзошла текущие решения NASA Новая карта детализирует…
- #9795OpenAI закупает десятки тысяч Mac mini и Mac Studio для RL обучения агентов…
OpenAI закупает десятки тысяч Mac mini и Mac Studio для RL обучения агентов Причина отхода от классических GPU – в унифицированной памяти Apple UMA, которая…
- #9794"До отправки рабочего документа в нейросеть 3… 2… 1… клик Таблица с цифрами,…
"До отправки рабочего документа в нейросеть 3… 2… 1… клик Таблица с цифрами, фрагмент договора, описание клиента — всё это может оказаться в личном аккаунте…