Забыл дописать. Посмотрел на ускорения для 14 добавленных автором задач, из них 3 не имели ускорения, а вот пятёрка запомнившихся: Task 1, MLA из DeepSeek v3 (но для 1 GPU), ускорение 1.76x Task 3, вся модель DeepSeek v3 (а значит и R1), но в сильно меньшем размере, как и писал, чтобы влезло на 1 GPU, 1.09x Task 5, модель S4 (не трансформер), какое-то невероятное ускорение, 30.36x Task 10, RWKV (ещё одна альтернатива трансформерам), 3.26x Task 11, Mamba 2 (смесь трансформеров и SSM, писал про неё тут), 7.18x (напомню, все цифры — для инференса, то есть генерации, а не тренировки) Все задачи тут, а лучшие решения здесь. Как видим, самые большие ускорения наблюдаются в необычных архитектурах, отличных от самых распространённых. Правда важным аспектом является то, что обычно для этих моделей сами авторы пишут эффективные имплементации, так как без них даже если они смогут продемонстрировать прирост по отношению к LLM на трансформерах, то будут существенно менее эффективными, а значит скорее всего ненужными. Здесь же в качестве бейзлайна взяты наивные имплементации, то есть очень простые, основанные только на PyTorch-операциях и torch.compile(). И вот по отношению к ним такие приросты. В моём понимании, теперь авторам fancy-архитектур будет чуть проще, ибо как показал эксперимент они могут закинуть в агента на o3-mini код своей модели и попросить переписать эффективно. Сжечь $500 и получить ускорение в 3-10 раз, а то и больше — звучит клёво.