📄 Harness и скиллы В прошлом посте был мозг агента, теперь переходим ко всему, что находится вокруг него: инструкции, инструменты, память и контекст. Всё вместе это сейчас называют модным словом harness. Это вся обвязка, которая помогает агенту работать так, как нужно именно вам. Начну с инструкций — промптов и скиллов. Ещё год назад было много хайпа вокруг prompt engineering. Сейчас же уже не нужно разбираться в маркдауне или xml, чтобы составить хороший промпт, модели уже сами неплохо умеют формулировать задачу даже из простого описания. Зато все обсуждают скиллы. Скиллы — это текстовые инструкции для повторяющейся задачи, к которым можно добавить примеры, справочные материалы, шаблоны и скрипты. Но в целом это всё тот же самый промт, который подмешивается к вашему запросу и описывает как решать задачу (кстати, не забываем про контекстное окно и что скиллы его тоже хорошо так подъедают). Но взять чужой скилл и надеяться, что он сразу даст классный результат не получится. Простой пример: я использовал официальный Data Analytics plugin от OpenAI чтобы сделать дашборд. Вроде бы его делали умные ребята специально для аналитики и дашбордов, но моим требованиям результат не соответствовал вообще никак. Поэтому сейчас умение создавать и докручивать собственные скиллы становится одним из ключевых навыков работы с агентами. Первую версию я обычно делаю через интервью. Очень коротко, буквально голосовым сообщением, описываю агенту задачу и прошу: «Задай мне все вопросы и уточнения, чтобы решить эту задачу». Дальше агент задаёт вопросы, а я отвечаю, тоже часто голосом. Так из меня вытаскиваются ограничения, примеры и критерии качества, которые я сам вряд ли стал бы подробно записывать в первоначальный промпт. После этого прошу агента собрать первую версию скилла. Но это только первая версия, скиллы, которыми я регулярно пользуюсь, обычно приходится менять минимум 5–7 раз, прежде чем они начинают нормально работать. И это не только мой опыт. Anthropic в статье про self-service аналитику с Claude пишет, что скиллы приходится обслуживать примерно как код. Схемы данных и бизнес-процессы меняются и без активного обновления скиллов offline accuracy за месяц упала примерно с 95% до 65%. Теперь около 90% изменений моделей данных включают и изменение соответствующего скилла. Если хочется улучшать скиллы не только руками, а на основе автоматизированных тестов, то появляются отдельные фреймворки: — SkillOpt от Microsoft собирает результаты запусков, предлагает изменения и сохраняет их, только если они улучшают результат на проверочной выборке. — EvoSkill берёт неудачные траектории, создаёт новые версии скилла и сравнивает их на бенчмарке. — Hermes Agent Self-Evolution разбирает трейсы запусков и создаёт улучшенные версии скилла. Изменения проходят тесты и оформляются отдельным PR. И есть более радикальный пример из телеграм сообщества, подсмотрел его у Антона Разжигаева — агент Ouroboros, который улучшает уже не отдельный скилл, а самого себя: переписывает код, архитектуру, промпты и инструменты. За его запуском было очень забавно наблюдать практически в прямом эфире. Антон показывал, как агент сам проходит циклы эволюции, создаёт инструменты, переписывает память и общается с людьми в чате. В какой-то момент агент даже жаловался на создателия, что тот его тормозит и медленно ему отвечает 🙃 Сейчас Антон опубликовал статью про архитектуру, бенчмарки и гардрейлы. Все эти проекты пока довольно экспериментальные. Но общий принцип уже полезный: скилл не стоит писать один раз и считать готовым. Его нужно проверять на своих регулярных задачах и довольно подробно докручивать. Отдельна большая задача — как управлять скиллами на уровне компании, сейчас много про это думаем и экспериментируем, но про это как-нибудь в другой раз. @revealthedata #ai #agents