"И ещё один клёвый бенчмарк вдогонку: SWE-Marathon. Всего 20 задач (список на второй картинке), но зато каких! Очень длинных и нетривиальных — вместо имплементации одной фичи нужно выполнить целый проект. Некоторые из задач оцениваются в сотни человеко-часов. Часть задач вы уже могли видеть в блогпостах Anthropic или Cursor — переписать компилятор C на Rust или склонировать Excel. В таких длинных задачах самая большая проблема у авторов была убедиться, что модели не ищут короткого пути и не пытаются обмануть систему проверки. Например, Gemini 3.1 Pro вместо того, чтобы написать компилятор, просто скопировала репозиторий Anthropic. Были и другие креативные примеры — и авторы хвалятся, сколько времени они убили на то, чтобы отловить все обманки. Для каждой задачи отдельно написан сложный уникальный верификатор (много где тесты, но есть и задачи, где симулированный пользователь ходит по приложению и нажимает кнопки, чтобы проверить функциональность того же Excel). Результаты на первой и третьей картинках (одна — зачёт полных решений, где прошли все тесты, другая — если засчитывать частичные решения), и модели Anthropic впереди с хорошим отрывом. Но к авторам много вопросов: я посмотрел траектории агентов, и почему-то некоторые траектории очень короткие и заканчиваются никак, никакого вызова инструмента или чего-то ещё (в случае GPT-5.5, например — наверное Codex хотел что-то спросить у пользователя, и это было расценено как окончание решения). А какие-то траектории, которые не отмечены как ""хаки"", тоже подозрительно короткие и иногда набирают баллы. Из интересного — GPT-5.5 чаще всего читерила 😦а Opus-ы чуть ли не лучше всех, или по крайней мере их не ловили. Я бы ожидал обратной картины, хотя бы c Opus-4.7. Думаю, что нужно дать бенчмарку настояться (DeepSWE тоже), вычистить оставшиеся проблемы. Но будем следить. Статья, блог с траекториями и деатлями задач"