GRPO в процессе тут очень много всего нужно настроить, удобно реализовать поддержку своих ревард функций и возможность их удобно конструировать много разных датасетов завезти ну и всякое прочее DPO тоже попозже будет
GRPO в процессе тут очень много всего нужно настроить, удобно реализовать…
0 viewsОткрыть в Telegram →
Из этого канала
- #5575+ в ближайшее время буду делать расширенную версию инструкции по использованию,…
+ в ближайшее время буду делать расширенную версию инструкции по использованию, мб картинок и скринов добавлю чтобы прям суперпонятно было
- #5577https://huggingface.co/collections/open-r1/reasoning-datasets
https://huggingface.co/collections/open-r1/reasoning-datasets
- #5578работа над конструктором ревардов) пока еще много тестов впереди думаю что…
работа над конструктором ревардов) пока еще много тестов впереди думаю что по-дефолту будет возможность врубить одним кликом дотюн на gsm8k…
- #5567https://arxiv.org/abs/2601.01400
https://arxiv.org/abs/2601.01400
- #5566DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement…
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning https://arxiv.org/abs/2501.12948v2 4 числа апдейтнули 22 -> 86 страниц