Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они регулярно берут какую-то из базовых Gemma и делают из неё то полноценный энкодер-декодер (T5Gemma, https://t.me/gonzo_ML/4421), то теперь вот диффузионно-блочную модельку, которая поочерёдно диффузией генерит блоки по 256 токенов. И даёт при этом 1500 токенов в секунду. Для промышленного инференса в облаке может и не такой биг дил, там большими батчами эффективность использования железа повышают, а вот для локальных моделек самое то. Возлагаю большие надежды на такие подходы. Когда же уже нормальное домашнее железо + быстрые модели хорошего качества. DiffusionGemma Technical Report __DiffusionGemma Team, Google DeepMind__ Paper: https://arxiv.org/abs/2608.00146 Code: https://github.com/google/hackable_diffusion Review: https://arxiviq.substack.com/p/diffusiongemma-technical-report Model: https://deepmind.google/models/gemma/diffusiongemma/ # TL;DR ЧТО сделали: Авторы представляют DiffusionGemma (на самом деле представили они её раньше, сейчас наконец доехал техрепорт) — экспериментальную открытую диффузионную текстовую модель с 25.2 млрд параметров (3.85 млрд активных), построенную на базе смеси экспертов (MoE) Gemma 4 26B A4B. Вместо последовательной генерации «слева направо» токен за токеном DiffusionGemma параллельно и итеративно уточняет «холсты» размером в 256 токенов. Обходя классическое диффузионное предобучение с нуля, модель инициализируется весами уже обученной авторегрессионной модели и дообучается через двухэтапный пайплайн: Supervised Fine-Tuning (SFT) и новый совместный этап дистилляции сэмплера и обучения с подкреплением (Sampler Distillation & Reinforcement Learning, SD-RL). ПОЧЕМУ это важно: Стандартные авторегрессионные LLM при обработке одиночных запросов упираются в пропускную способность памяти: они тратят значительно больше времени на пересылку весов и KV-кэша из памяти HBM в вычислительные блоки, чем на сами арифметические операции. DiffusionGemma переводит процесс генерации из режима memory-bound в compute-bound, выдавая около 20 токенов за один прямой проход (forward pass) и достигая скорости порядка 1500 выходных токенов в секунду на одной GPU NVIDIA H100. Это обеспечивает ускорение в 7.1 раза по сравнению с авторегрессионным бейзлайном при сохранении способностей к рассуждениям, длинному контексту и мультимодальности. Для практиков: Для техлидов и архитекторов систем DiffusionGemma знаменует собой практический прорыв в безавторегрессионной генерации текста. Превратив сильную MoE-модель в дискретный диффузионный движок и потратив менее 10% от исходного бюджета токенов на обучение, Google DeepMind доказала: высокая скорость параллельной генерации не требует жертв со стороны сложного ризонинга. Веса выложены под лицензией Apache 2.0 вместе с эталонными реализациями в vLLM и HuggingFace Transformers, что даёт сообществу готовый высокопроизводительный фундамент для систем реального времени, агентских пайплайнов и низколатентных сервисов. Разбор тут: https://t.me/gonzo_ML_podcasts/4794
Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они…
Из этого канала
- #5935Соскучились по новым законам скейлинга? Их есть у меня! Для более критического…
Соскучились по новым законам скейлинга? Их есть у меня! Для более критического восприятия добавил прожарку.
- #5931Прикольная работа про экономию памяти для работы с длинными…
Прикольная работа про экономию памяти для работы с длинными последовательностями. Использует то же наблюдение, что и недавняя работа про новый BERT — семантика…
- #5926По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with…
По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with Compute Flexibility Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang,…