https://arxiv.org/abs/2601.01400
0 viewsОткрыть в Telegram →
Из этого канала
- #5574GRPO в процессе тут очень много всего нужно настроить, удобно реализовать…
GRPO в процессе тут очень много всего нужно настроить, удобно реализовать поддержку своих ревард функций и возможность их удобно конструировать много разных…
- #5575+ в ближайшее время буду делать расширенную версию инструкции по использованию,…
+ в ближайшее время буду делать расширенную версию инструкции по использованию, мб картинок и скринов добавлю чтобы прям суперпонятно было
- #5577https://huggingface.co/collections/open-r1/reasoning-datasets
https://huggingface.co/collections/open-r1/reasoning-datasets
- #5566DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement…
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning https://arxiv.org/abs/2501.12948v2 4 числа апдейтнули 22 -> 86 страниц
- #5565Scaling Open-Ended Reasoning to Predict the Future…
Scaling Open-Ended Reasoning to Predict the Future https://www.arxiv.org/abs/2512.25070 https://www.alphaxiv.org/ru/overview/2512.25070…