Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они регулярно берут какую-то из базовых Gemma и делают из неё то полноценный энкодер-декодер (T5Gemma, https://t.me/gonzo_ML/4421), то теперь вот диффузионно-блочную модельку, которая поочерёдно диффузией генерит блоки по 256 токенов. И даёт при этом 1500 токенов в секунду. Для промышленного инференса в облаке может и не такой биг дил, там большими батчами эффективность использования железа повышают, а вот для локальных моделек самое то. Возлагаю большие надежды на такие подходы. Когда же уже нормальное домашнее железо + быстрые модели хорошего качества. DiffusionGemma Technical Report __DiffusionGemma Team, Google DeepMind__ Paper: https://arxiv.org/abs/2608.00146 Code: https://github.com/google/hackable_diffusion Review: https://arxiviq.substack.com/p/diffusiongemma-technical-report Model: https://deepmind.google/models/gemma/diffusiongemma/ # TL;DR ЧТО сделали: Авторы представляют DiffusionGemma (на самом деле представили они её раньше, сейчас наконец доехал техрепорт) — экспериментальную открытую диффузионную текстовую модель с 25.2 млрд параметров (3.85 млрд активных), построенную на базе смеси экспертов (MoE) Gemma 4 26B A4B. Вместо последовательной генерации «слева направо» токен за токеном DiffusionGemma параллельно и итеративно уточняет «холсты» размером в 256 токенов. Обходя классическое диффузионное предобучение с нуля, модель инициализируется весами уже обученной авторегрессионной модели и дообучается через двухэтапный пайплайн: Supervised Fine-Tuning (SFT) и новый совместный этап дистилляции сэмплера и обучения с подкреплением (Sampler Distillation & Reinforcement Learning, SD-RL). ПОЧЕМУ это важно: Стандартные авторегрессионные LLM при обработке одиночных запросов упираются в пропускную способность памяти: они тратят значительно больше времени на пересылку весов и KV-кэша из памяти HBM в вычислительные блоки, чем на сами арифметические операции. DiffusionGemma переводит процесс генерации из режима memory-bound в compute-bound, выдавая около 20 токенов за один прямой проход (forward pass) и достигая скорости порядка 1500 выходных токенов в секунду на одной GPU NVIDIA H100. Это обеспечивает ускорение в 7.1 раза по сравнению с авторегрессионным бейзлайном при сохранении способностей к рассуждениям, длинному контексту и мультимодальности. Для практиков: Для техлидов и архитекторов систем DiffusionGemma знаменует собой практический прорыв в безавторегрессионной генерации текста. Превратив сильную MoE-модель в дискретный диффузионный движок и потратив менее 10% от исходного бюджета токенов на обучение, Google DeepMind доказала: высокая скорость параллельной генерации не требует жертв со стороны сложного ризонинга. Веса выложены под лицензией Apache 2.0 вместе с эталонными реализациями в vLLM и HuggingFace Transformers, что даёт сообществу готовый высокопроизводительный фундамент для систем реального времени, агентских пайплайнов и низколатентных сервисов. Разбор тут: https://t.me/gonzo_ML_podcasts/4794
Наконец доехал техрепорт по DiffusionGemma. Мне нравится подход команды, они…
Из этого канала
- #5950Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много…
Ещё по заявкам читателей. Спасибо Teo за ссылку на интересную статью! Мы много писали про динамические вычисления, когда слои вычисляются в разном порядке, с…
- #5956Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See…
Внутренняя магия оптимизаторов и калибровочные симметрии. The Loss Does Not See the Basis, but Adam Does Devender Singh Paper: https://arxiv.org/abs/2608.05136…
- #5962Мы с @alexanderchemeris завели новый канал https://t.me/gonzoworlds. Там мы…
Мы с @alexanderchemeris завели новый канал https://t.me/gonzoworlds. Там мы будем делать разборы статей по World Models и всему вокруг, что пересекается с…
- #5935Соскучились по новым законам скейлинга? Их есть у меня! Для более критического…
Соскучились по новым законам скейлинга? Их есть у меня! Для более критического восприятия добавил прожарку.
- #5931Прикольная работа про экономию памяти для работы с длинными…
Прикольная работа про экономию памяти для работы с длинными последовательностями. Использует то же наблюдение, что и недавняя работа про новый BERT — семантика…