Measuring Automated Kernel Engineering Работа от METR в том же направлении, сделанная одним из сотрудников всего за 4 недели. Но сначала пара слов о том, почему METR, компании, занимающейся оценкой угроз от AI, это интересно. Они считают, что важно понимать способность автоматизировать исследования и разработку в области ИИ, так как это может может обеспечить рекурсивное самоулучшение ИИ. Написание эффективных кернелов является одним из узких мест, оптимизация которого может привести к ускорению автоматизации. Так вот, они взяли тот же KernelBench, что и Nvidia, немного почистили и добавили 13 задач 5-го уровня сложности от себя — они опираются на последние модели, так что очень приближены к практике. Из числа новых 5 задач на оптимизацию частей DeepSeek-V3, 2 на LLAMA 3, 3 для Hunyuan Video (китайская модель генерации видео). Тут уже берутся не конкретные кернелы, а целые модели, которые состоят из большой цепочки вызовов разных операций. В качестве бейзлайнов по ним взяты наивные имплементации в PyTorch, а не что-то высокозаоптимизированное. Ещё одним важным фактором является то, что размер моделей был уменьшен, чтобы вмещаться в 1 видеокарту — что приемлемо для большинства способов использования в сообществе, но точно не подходит для передовых компаний. Забегая вперёд скажу, что в решениях (=оптимизированных кернелах и моделях) задач 5-го уровня в среднем по 500 строк кода (но есть и по 1500+), из них 100 — комментарии. Далее автор сделал «агента» KernelAgent, но по сути это то же, что я описал выше. Отличие по сути одно: всего генерация новых кернелов запускается 300 раз (40 для o1, так как она дорогая 😀), и одновременно происходит 8 параллельных и независимых генераций. Как только одна заканчивается — она оценивается, и затем среди всех выбирается лучшая для запуска следующего цикла. R1 в тестах не участвовала, так как «у модели нет достаточно надёжных API-провайдеров» (читай быстрых + недорогих + не падающих из-за перегрузки).
Measuring Automated Kernel Engineering Работа от METR в том же направлении,…
Из этого канала
- #2317Вот два главных графика, в обоих по вертикали — среднее геометрическое…
Вот два главных графика, в обоих по вертикали — среднее геометрическое достигнутого ускорения относительно бейзлайна (усреднение идёт по всем задачам в…
- #2319Спиколошная (Текстовые версии никуда не денутя, аудио - вдобавок, а не взамен)
Спиколошная (Текстовые версии никуда не денутя, аудио - вдобавок, а не взамен)
- #2321Забыл дописать. Посмотрел на ускорения для 14 добавленных автором задач, из них…
Забыл дописать. Посмотрел на ускорения для 14 добавленных автором задач, из них 3 не имели ускорения, а вот пятёрка запомнившихся: Task 1, MLA из DeepSeek v3…
- #2314Слоган пары следующих постов — «what gets measured gets improved». Сначала…
Слоган пары следующих постов — «what gets measured gets improved». Сначала 12-го февраля Nvidia выпустила блогпост.
- #2313Как раз на днях вышла статья от Google, где они показывают масштабирование…
Как раз на днях вышла статья от Google, где они показывают масштабирование Visual-Language модели на 100 миллиардов картинок и пытаются оценить, становятся ли…