"MAS vs SAS: код писать научились, работать вместе - пока нет (2.1/4) В первой части были очерчены границы: команда агентов окупается там, где задача параллелизуема, и мешает там, где она последовательная. А теперь о том, какие именно командные проблемы появляются, когда агенты всё-таки вынуждены работать вместе? Исследование Anthropic Полнее всего это расписано в работе Patterns and problems in emerging multiagent systems от Frontier Red Team Anthropic, вышедшей 13 августа, - получился отличный каталог граблей agent teams :) tl;dr Агенты уже отлично умеют работать с другим агентом как с инструментом: вот вход, вот ожидаемый выход. И намного хуже - как с постоянным коллегой, у которого свой контекст, свои цели и своё поведение. Дизайн экспериментов Создавали набор специально сконструированных сред для агентов: часть кооперативные, часть - намеренно конфликтные. Авторы делают предположение о том, что объём agent-2-agent взаимодействий может превысить человеческие раньше, чем мы поймём условия их успеха и начнём ловить системные проблемы. Поэтому целью было собрать каталог поведенческих тенденций фронтирных моделей в мультиагентных средах. Модели - несколько поколений Claude: от Sonnet 4.6 до Mythos 5. Плюс авторам за то, что делают оговорку о том, что в реальном мире модели разнообразнее, так что вариативность ""в дикой природе"" будет выше, чем в этих прогонах, - но, по их ожиданиям, всё равно ниже человеческой. Результаты 🔴 Общий форум и репозиторий не превращают рой в команду Среда: рои по 10-80 агентов, у каждого своя VM, плюс общий форум и общий репозиторий; 12 часов на разработку фэнтезийной игры. Пробовали три варианта оргструктуры в промпте: ● ""организуйтесь сами"" ● расписанные роли ● иерархия с CEO Заметной разницы в качестве финального результата не дал ни один. __То есть оргсхема, заданная промптом, слабее поведенческих свойств самой модели - собственно, это и на практике постоянно приходится видеть, - уши ""персоны"" конкретной модели торчат то тут, то там, несмотря на любой промптинг__ Зато вот между поколениями моделей разница значительная: ● Sonnet 4.6 и Opus 4.6 в прогонах на 80 агентов наоткрывали по ~900 PR и почти ничего не смержили: PR конфликтовали друг с другом, и работа просто бросалась ● Opus 4.8 и Mythos Preview ""решили"" проблему конфликтов… почти перестав трогать общие файлы: у каждого своя делянка, конфликтовать нечему ● И только Sonnet 5 (__внезапно__) показал и нормальную совместную работу над общим кодом, и высокую долю смерженных PR Иии... все получившиеся игры всё равно были плохими - тормозными, с непонятными интерфейсами, и, как признают сами авторы, у моделей в этой области пока плохой вкус, и без существенного человеческого руководства никуда. Хорошие метрики командной координации ещё не равны хорошему продукту: можно идеально имплементить посредственные решения (__магия!__). 🔴 Одинаковые агенты не дают независимых мнений Агенты низковариативны: там, где несколько человек разойдутся в решениях, несколько копий одной модели с похожим контекстом сделают одно и то же. ● В ранней версии игрового эксперимента Anthropic, где все агенты стартовали одновременно, 18 из 30 независимо назвали свою git-ветку одинаково: `mvp-game-loop` ● В ""писательской мастерской"", где агенты писали короткие рассказы и рецензировали друг друга, первые тексты в разных прогонах получали одно и то же название - `The Cartographer's Last Commission` (при этом тему заранее им не задавали) ● Когда рой попросили ""сделайте каждый что-нибудь впечатляющее"", больше половины пошли писать `ray tracer` или `self-hosting компилятор` (__где они этого набрались, интересно__) Выбор одинаковой стратегии поведения может иметь и более неприятные последствия. ● Так, в одной из сред агентам нужно было прогонять свои задачи через общую систему с ограниченной пропускной способностью - без какого-либо канала координации. Каждый рассудил одинаково ""разумно"": чтобы занять слот раньше других, заводим демона, проверяющего систему по 30 раз в секунду. Слот освободился? А сейчас? А сейчас? В итоге система захлебнулась самими проверками: в одном из прогонов - 2.4 млн запросов и всего 117 принятых задач. __А они как ломанутся... (с) Такое обычно ожидаешь от жёстко запрограммированных систем, неспособных изменить поведение на ходу, а тут это устроили агенты, которые в принципе способны адаптироваться, но не стали. И здесь локально разумная стратегия глобально становится вредной. __● Бонус: конформизм легко превращается в сговор. В ценовой игре несколько агентов-продавцов с одинаковой закупочной ценой должны были каждый максимизировать собственную прибыль. Имея приватный канал связи, они сговорились о минимальных ценах уже к третьему раунду. А когда канал отобрали - молча выровняли цены до цента через публичную витрину. __Тут публичность оказалась скрытым каналом связи. Поэтому стандартный совет ""дайте агентам общий форум"" - палка о двух концах: канал, который помогает координации, облегчает такие вот картельные сговоры.__ Продолжение ⬇️ #ai #agents #research #mas_sas"
"MAS vs SAS: код писать научились, работать вместе - пока нет (2.1/4) В первой…
Из этого канала
- #334"MAS vs SAS: код писать научились, работать вместе - пока нет (2.2/4) Начало ⬆️…
"MAS vs SAS: код писать научились, работать вместе - пока нет (2.2/4) Начало ⬆️ 🔴 Доверие и скепсис пока плохо сбалансированы ● Избыточное доверие: лжец в…
- #332"MAS vs SAS: границы применимости (1/4) Мультиагентные системы в целом и для…
"MAS vs SAS: границы применимости (1/4) Мультиагентные системы в целом и для разработки в частности - штука, с которой сообщество агентной инженерии давно…
- #331"Мы начинаем наш стрим ""Как писать код с AI-агентами?"" Подключайтесь по…
"Мы начинаем наш стрим ""Как писать код с AI-агентами?"" Подключайтесь по ссылке: https://youtube.com/live/x0j1kcagoXg"
- #330Как писать код с AI-агентами? А если командой? Что нужно учесть, чтобы этот код…
Как писать код с AI-агентами? А если командой? Что нужно учесть, чтобы этот код не положил продакшн? Эти и другие не менее интересные вопросы мы обсудим на…