Вот два главных графика, в обоих по вертикали — среднее геометрическое достигнутого ускорения относительно бейзлайна (усреднение идёт по всем задачам в бенчмарке). В первом по горизонтали — кумулятивная цена зпуска агента, то есть это график качества на доллар. Самая правая точка — $20 за одну оптимизационную задачу (не за весь бенчмарк). Во втором по горизонтали количество попыток, сделанных моделями. По обоим графикам заметно, что o3-mini с последним удешевлением цен вне конкуренции — она и показывает самое большое ускорение, и делает это наиболее эффективно/быстро. В пике модель достигает среднего геометрического ускорения на 81%, то есть чуть меньше чем в 2 раза. Во втором графике видно, что в пересчёте качества на количество попыток o1 берёт хороший старт, но к сожалению из-за цены больше 40 итераций (запросов на оптимизацию) её не запускали. Представьте как o3 лихо возьмёт 😱~~может поэтому её и решили не релизить?~~ Sonnet 3.6 держится хорошо, так как он существенно дешевле o1, то в пересчёте на доллары достигает ускорения в 60% «быстрее», хотя на самом деле ему требуется в 7 раз больше итераций. === Но $20 на одну задачу, особенно для пятого уровня, где идёт оптимизация уже целых архитектур — это же преступно мало! Представляете сколько суммарно долларов по всему миру сжигается на запуск условной LLAMA-3? И что означает ускорение даже на 5-10%? а на 40%? Да даже по сравнению с работой инженера-человека это куда выгоднее — рыночная цена этих задач по оптимиации, вероятно, превышает 500 долларов (уплаченных инженеру за 2-4 часа его времени). Автор пишет, что «по приблизительным оценкам, оптимизированные кернелы могут экономить по меньшей мере сотни миллионов долларов в год по всему миру». А мы тут получаем ускорения за двадцатку! Но я рад, что Nvidia запостила схожие результаты, значит, держат руку на пульсе, там всё схвачено, скоро назревают реальные ~~изменения~~ ускорения 😀 === Важные уточнения: — результаты не подразумевают, что LLM-агенты уже могут автоматизировать разработку кернелов с нуля — сравнение по ускорению не совсем честное, так как в публичном доступе нет кернелов, которые используют META/OpenAI/DeepSeek — ничего из этого не публикуется. Так как оптимизация затрат на инференс моделей приносит огромные ROI, то этим точно плотно занимаются инженерные команды этих и других компаний. — инженеры этих компаний в приватной беседе подтвердили, что хоть результаты и кажутся значимыми («ускорение на 30-40%!») — они далеки от того, что происходит внутри — Плюс, напомню от себя, что все вышеописанные действия происходят с кернелами на 1 GPU, что по сути не актуально для фронтир-компаний.