DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning https://arxiv.org/abs/2501.12948v2 4 числа апдейтнули 22 -> 86 страниц
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement…
0 viewsОткрыть в Telegram →
Из этого канала
- #5567https://arxiv.org/abs/2601.01400
https://arxiv.org/abs/2601.01400
- #5574GRPO в процессе тут очень много всего нужно настроить, удобно реализовать…
GRPO в процессе тут очень много всего нужно настроить, удобно реализовать поддержку своих ревард функций и возможность их удобно конструировать много разных…
- #5575+ в ближайшее время буду делать расширенную версию инструкции по использованию,…
+ в ближайшее время буду делать расширенную версию инструкции по использованию, мб картинок и скринов добавлю чтобы прям суперпонятно было
- #5565Scaling Open-Ended Reasoning to Predict the Future…
Scaling Open-Ended Reasoning to Predict the Future https://www.arxiv.org/abs/2512.25070 https://www.alphaxiv.org/ru/overview/2512.25070…
- #5564Ну что континьюс претрейнинг для qwen-0.5B свежевыкачанного с HF поехал. Вроде…
Ну что континьюс претрейнинг для qwen-0.5B свежевыкачанного с HF поехал. Вроде круто