Вышел Qwen 3 от Alibaba: https://qwenlm.github.io/blog/qwen3/ В релиз включены как Dense-модели, так и трансформеры с микстурой экспертов. Самая большая модель, Qwen3-235B-A22B, по сути быстрее, чем 32B-версии (так как всего 22B активных параметров) — и она показывает результаты повыше o1 / R1. Есть версия на 32B, как и в прошлом поколении, и варианты поменьше — на 0.6B, 1.7B, 4B, 8B и 14B. Последние учились с дистилляцией навыков от старших братьев. Все модели, включая самые маленькие, поддерживают два режима: с рассуждениями и без (как Claude 3.7). Все модели обучали на более чем 100 языках, включая русский и украинский, и 36 триллионах токенов. Больше — в карточках моделей. Попробовать бесплатно — тут: https://chat.qwen.ai/ UPD: а ну и удачи META завтра на LLAMACON 😀 как бы снова не свернули релизы
Вышел Qwen 3 от Alibaba: https://qwenlm.github.io/blog/qwen3/ В релиз включены…
Из этого канала
- #2547Завтра мы прощаемся с GPT-4 в ChatGPT. Зайдите напоследок поспрашивать её о том…
Завтра мы прощаемся с GPT-4 в ChatGPT. Зайдите напоследок поспрашивать её о том о сём, чтобы увидеть разницу в качестве, которую мы получили за 2 года.
- #2548Недавно на одной встрече, очень большой начальник заметил: с учётом того, что…
Недавно на одной встрече, очень большой начальник заметил: с учётом того, что мы теперь много нанимаем по всему миру и в разных часовых зонах, умение писать…
- #2549We'll get GPT-5 before GTA VI...
We'll get GPT-5 before GTA VI...
- #2544🆒 все посты за сегодня написаны стоя и на новой клавиатуре 🆒 держу в курсе
🆒 все посты за сегодня написаны стоя и на новой клавиатуре 🆒 держу в курсе
- #2542Картинки с иллюстрацией методов
Картинки с иллюстрацией методов