Measuring Automated Kernel Engineering Работа от METR в том же направлении, сделанная одним из сотрудников всего за 4 недели. Но сначала пара слов о том, почему METR, компании, занимающейся оценкой угроз от AI, это интересно. Они считают, что важно понимать способность автоматизировать исследования и разработку в области ИИ, так как это может может обеспечить рекурсивное самоулучшение ИИ. Написание эффективных кернелов является одним из узких мест, оптимизация которого может привести к ускорению автоматизации. Так вот, они взяли тот же KernelBench, что и Nvidia, немного почистили и добавили 13 задач 5-го уровня сложности от себя — они опираются на последние модели, так что очень приближены к практике. Из числа новых 5 задач на оптимизацию частей DeepSeek-V3, 2 на LLAMA 3, 3 для Hunyuan Video (китайская модель генерации видео). Тут уже берутся не конкретные кернелы, а целые модели, которые состоят из большой цепочки вызовов разных операций. В качестве бейзлайнов по ним взяты наивные имплементации в PyTorch, а не что-то высокозаоптимизированное. Ещё одним важным фактором является то, что размер моделей был уменьшен, чтобы вмещаться в 1 видеокарту — что приемлемо для большинства способов использования в сообществе, но точно не подходит для передовых компаний. Забегая вперёд скажу, что в решениях (=оптимизированных кернелах и моделях) задач 5-го уровня в среднем по 500 строк кода (но есть и по 1500+), из них 100 — комментарии. Далее автор сделал «агента» KernelAgent, но по сути это то же, что я описал выше. Отличие по сути одно: всего генерация новых кернелов запускается 300 раз (40 для o1, так как она дорогая 😀), и одновременно происходит 8 параллельных и независимых генераций. Как только одна заканчивается — она оценивается, и затем среди всех выбирается лучшая для запуска следующего цикла. R1 в тестах не участвовала, так как «у модели нет достаточно надёжных API-провайдеров» (читай быстрых + недорогих + не падающих из-за перегрузки).