Qwen3.8-27B теперь работает со скоростью 70 токенов/с прямо на ноутбуке. Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии. DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена. Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX. Суть подхода: https://inco.ai/blog/dflash2/ А я напомню, что уже есть модель без цензуры :) tg / max