"Ещё один бенчмарк, теперь от Cognition (авторов Devin) — FrontierCode (блог). Здесь большой упор сделан на то, может ли агент написать код, который мейнтейнер репозитория с кодом может в один клик смерджить (то есть включить изменения в общий проект). Для этого надо соблюдать заданные правила репозитория: как выглядят тесты, что тесты не бессмысленны и ломаются, если что-то не так, комментарии адекватные, их не много, но и не мало, код написан хорошо итд. В расширенной версии бенчмарка 150 задач, в основной 100, а в ""золотой"" версии — 50 (поэтому на картинке с метриками для каждой модели три столбика). Чтобы получить цифры, каждую задачу прогоняли по 5 раз. Задачи брали из реальных репозиториев и привлекали основных разработчиков, которые тратили более 40 часов на каждую задачу (не чтобы написать код решения, а чтобы сделать описание + проверки качественно, составить рубрики проверки, предотвратить хаки моделями). При этом промпты с описанием что нужно сделать относительно короткие (но их длина фактически удваивается при добавлении правил репозитория о том, как должен выглядеть код). На сайте больше деталей + есть детальная разбивка качества по разным reasoning effort (в цене, токенах, шагах агента, времени — очень детально). Opus 4.8 xHigh обходит всех с большим запасом (страшно представить, что будет с Mythos...), GPT-5.5-medium чуть лучше Opus-4.7 (ждём GPT-5.6, доколе???), опенсурс и собственная моделька Cognition я бы сказал не всплывают. Жаль, что Composer 2.5 не померили."