Вышел Qwen 3 от Alibaba: https://qwenlm.github.io/blog/qwen3/ В релиз включены как Dense-модели, так и трансформеры с микстурой экспертов. Самая большая модель, Qwen3-235B-A22B, по сути быстрее, чем 32B-версии (так как всего 22B активных параметров) — и она показывает результаты повыше o1 / R1. Есть версия на 32B, как и в прошлом поколении, и варианты поменьше — на 0.6B, 1.7B, 4B, 8B и 14B. Последние учились с дистилляцией навыков от старших братьев. Все модели, включая самые маленькие, поддерживают два режима: с рассуждениями и без (как Claude 3.7). Все модели обучали на более чем 100 языках, включая русский и украинский, и 36 триллионах токенов. Больше — в карточках моделей. Попробовать бесплатно — тут: https://chat.qwen.ai/ UPD: а ну и удачи META завтра на LLAMACON 😀 как бы снова не свернули релизы