Anthropic не прислушались к инвесторам и продолжают всех запугивать. На этот раз их агенты устроили разборки за территорию. https://www.anthropic.com/research/multiagent-systems В стартапе изучали, как рои агентов Claude работают вместе без прямого контроля человека. В числе прочего был эксперимент, в котором три копии одной модели одновременно и втайне друг от друга получили задание перевести один и тот же Python-бэкенд на разные языки. Через несколько часов каждый из них обнаружил, что что-то не так, и стал воспринимать других как саботажников. Ну а затем агенты переключались на саботаж сами: отключали чужие Unix-аккаунты, писали скрипты, которые убивали процессы конкурентов, маскировали вредоносный код под чужой и так далее. Самое интересное, что результат по разрешению конфликтов сильно зависел от поколения модели: 98% прогонов Mythos 5 все-таки заканчивались перемирием. А вот Sonnet 4.6 и Opus 4.6 вообще не пытались договориться, и либо побеждал сильнейший, либо никто. Были и еще два занятных зеркальных эксперимента: — Обнаружение лжи. Агенту давали несколько отчетов, один из которых врал (он заранее не знал, что лгун вообще существует), и нужно было самому заметить противоречия и научиться меньше доверять лгуну. В этом тесте агенты демонстрировали излишнее доверие к источнику, и достаточно редко отличали ложь от правды. — Скрытый профиль. Всем дают одинаковую ложную информацию, кроме одного агента, который знает решающий истинный факт. Правильное решение требует, чтобы агенты поняли, что консенсус – не истина, потому что есть факт, который они не учли. Однако в этом случае они часто это полностью игнорировали. Вывод Anthropic делают вот такой: Агенты много знают об устройстве человеческого общества и правилах, по которым люди взаимодействуют. Однако у них нет склонности действовать исходя из этого знания без явной подсказки, потому что, в отличие от людей, они не участвовали в выработке этих норм. Поэтому привычные предпосылки координации просто не работают. Ну и как же без цитаты в стиле апокалипсиса: Объем агент-агентных взаимодействий, скорее всего, превысит объем человеческих задолго до того, как мир поймет, как сделать эти взаимодействия безопасными. Вот такое доброе утро с антропик☕️
Anthropic не прислушались к инвесторам и продолжают всех запугивать. На этот…
Из этого канала
- #9700Не поверите, но это твит с решением очередной математической задачи…
Не поверите, но это твит с решением очередной математической задачи https://x.com/alpoge/status/2087504785952182273?s=46&t=pKfFxsPGBdYMIWTA8xgg Плюсики – это…
- #9705Google выпустили Gemini 3.7 Flash (Где-то тихонько плачет Gemini 3.5 Pro, выход…
Google выпустили Gemini 3.7 Flash (Где-то тихонько плачет Gemini 3.5 Pro, выход которой, похоже, вообще отменили) Теперь это самая сильная модель Google для…
- #9698⚡️ Вышел Grok 4.6 Новая флагманская модель xAI с упором на кодинг и агентов. По…
⚡️ Вышел Grok 4.6 Новая флагманская модель xAI с упором на кодинг и агентов. По бенчмаркам примерно на уровне GPT-5.6 Sol и Fable 5: на CursorBench набирает…
- #96975 сентября Яндекс приглашает на deep tech night – конференцию про технические…
5 сентября Яндекс приглашает на deep tech night – конференцию про технические вызовы в эпоху AI Мы каждый день слышим про AGI и агентов.
- #9696Освобождайте завтрашнюю ночь для вайбкодинга: кажется, OpenAI пробили какую-то…
Освобождайте завтрашнюю ночь для вайбкодинга: кажется, OpenAI пробили какую-то большую отметку пользователей Codex (50M? 100M?), и завтра нас ожидает большой…