Вышел Qwen-3.8 Flash-Next Это MoE 125B + 51B N-gram таблица (но активных всего 6B), которая бьет Opus 4.6 Max на 8 из 9 бенчмарков! Также превосходит Qwen3.8-27B и DeepSeek-V4-Flash. При этом обучение стоило в 9 раз дешевле, чем Qwen3.7-Plus. Немного про архитектуру. Ключевых новшества всего четыре: 1. Те самые N-gram эмбеддинги aka дешевая память. Это таблица, которая индексируется не по одному токену, а по коротким последовательностям. Модель как бы запоминает типичные локальные комбинации токенов напрямую в виде векторов, а не выучивает их заново на каждом шаге. Потом происходит обычный lookup вместо матричного умножения, поэтому такие эмбеддинги почти не добавляют вычислений на токен, зато сильно увеличивают общую емкость модели. 2. Gated DeltaNet + Qwen Sparse Attention для скорости на длинных контекстах. Модель не запоминает весь контекст целиком, а выбирает небольшие релевантные блоки и работает только с ними. Gated DeltaNet – линейный механизм внимания с гейтами, которые как раз управляют тем, что модель запоминает, а что забывает. Результат: на 1М контекста prefill стал в 7.6 раз быстрее, а decode – в 4.9 раз. 3. Gated Residual connections. Обычные residual-связи просто прокидывают информацию между слоями, а здесь добавлены гейты, которые решают, сколько именно информации пропустить дальше. 4. Оптимизатор Muon вместо классического Adam. Как раз один из факторов, давших 9-кратную экономию на обучении. В итоге обучение дешевле, параметров больше, а вычислений на токен меньше. Очередное достижение китайского опенсорса. Модель | Репорт | Блог
Вышел Qwen-3.8 Flash-Next Это MoE 125B + 51B N-gram таблица (но активных всего…
Из этого канала
- #9775Вышло интервью с Тибо: главой Codex/ChatGPT в OpenAI Это тот самый…
Вышло интервью с Тибо: главой Codex/ChatGPT в OpenAI Это тот самый парень-инсайдер, который постоянно намекает в X на релизы и объявляет об обнулении лимитов.
- #9771"❗ Распространите ❗ Найден ИИ-ассистент, который реально экономит рабочее время…
"❗ Распространите ❗ Найден ИИ-ассистент, который реально экономит рабочее время и не сливает корпоративные данные.
- #9770В OpenAI еще минус один Глава подразделения дата-центров Крис Малон покинул…
В OpenAI еще минус один Глава подразделения дата-центров Крис Малон покинул стартап прямо перед IPO.
- #9769FigureAI собирают самый гигантский и разнообразный в мире датасет для обучения…
FigureAI собирают самый гигантский и разнообразный в мире датасет для обучения роботов https://www.figure.ai/news/introducing-index Оказывается, стартап 4…