С бенчмарками для кодинговых агентов сейчас стало довольно неопределённо. Мне думается, что мы уже живём в какой-то пост-бенчмарк эпохе, когда всё сложнее и сложнее становится объективно оценивать модели. Тут, с одной стороны - сатурация бенчей, с другой - их контаминация и прочие проблемы с недоверием и методологиями, а с третьей ещё и то, что разницу на повседневных задачах между современными моделями и агентами стало непросто измерить. Тем не менее, новые бенчи появляются, и их авторы стараются учесть проблемы прошлых поколений, сделать более честные проверки и поднять планку сложности в тестах для агентов. Так что завтра поговорим обо всём вокруг кодинговых бенчмарков на стриме ⬇️ #announcement #stream #benchmarks
С бенчмарками для кодинговых агентов сейчас стало довольно неопределённо. Мне…
Из этого канала
- #310Бенчмарки! Новый митап про DeepSWE, SWE-rebench v2 и др Друзья, вы все еще…
Бенчмарки! Новый митап про DeepSWE, SWE-rebench v2 и др Друзья, вы все еще верите бенчмаркам? Я вот все меньше.
- #311"AgenticOps, часть №3 - платформа Общие принципы ● агенты общаются с платформой…
"AgenticOps, часть №3 - платформа Общие принципы ● агенты общаются с платформой через CLI + SKILL.md ● CLI-команды - плоские и максимально простые ● топология…
- #312"Сработаемся? Навеяно обсуждением бенчмарков на недавнем стриме и тестированием…
"Сработаемся? Навеяно обсуждением бенчмарков на недавнем стриме и тестированием Fable.
- #308AgenticOps, часть №2 - базовые компоненты Начну с того, на чём стоит сама…
AgenticOps, часть №2 - базовые компоненты Начну с того, на чём стоит сама платформа - с набора базовых инфраструктурных компонентов.
- #307"AgenticOps, часть №1 - мотивация (и КДПВ) Я давно уже пишу и рассказываю про…
"AgenticOps, часть №1 - мотивация (и КДПВ) Я давно уже пишу и рассказываю про то, что полноценно AI-driven SDLC невозможно выстроить поверх слабой…