Статья в репозитории: https://github.com/deepseek-ai/DeepSeek-R1 Метрики на скриншотах API уже доступен на официальном сайте DeepSeek по смешным (по сравнению с о1) ценам — выход, в том числе и рассуждения, дешевле в 25 раз. Но так как модель на 680 миллиардов параметров запустить сможет мало кто.. то они дистиллировали цепочки рассуждений в большое количество разных локальных моделей, Qwen, LLAMA 3 итд — выбирай не хочу! Их метрики на последней картинке 7B модельки лучше Opus / 4o на решении мат. задач, что ещё раз показывает важность обучения именно рассуждению, и что эта ось альтернатива масштабированию самих моделей Big day for the community Разница Zero версии R1 и обычной: > DeepSeek-R1-Zero, a model trained via large-scale reinforcement learning (RL) without supervised fine-tuning (SFT) as a preliminary step, demonstrated remarkable performance on reasoning. With RL, DeepSeek-R1-Zero naturally emerged with numerous powerful and interesting reasoning behaviors (про это говорили OpenAI). However, DeepSeek-R1-Zero encounters challenges such as endless repetition, poor readability, and language mixing. To address these issues and further enhance reasoning performance, we introduce DeepSeek-R1, which incorporates cold-start data before RL. UPD: на сайте chat.deepseek.com уже отвечает новая модель R1 UPD2: первая картинка обновлена, показывает сравнение цен. Модель дешевле o1-mini в несколько раз.