Scaling Open-Ended Reasoning to Predict the Future https://www.arxiv.org/abs/2512.25070 https://www.alphaxiv.org/ru/overview/2512.25070 https://github.com/OpenForecaster/scaling-forecasting-training https://openforecaster.github.io/
Scaling Open-Ended Reasoning to Predict the Future…
0 viewsОткрыть в Telegram →
Из этого канала
- #5566DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement…
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning https://arxiv.org/abs/2501.12948v2 4 числа апдейтнули 22 -> 86 страниц
- #5567https://arxiv.org/abs/2601.01400
https://arxiv.org/abs/2601.01400
- #5574GRPO в процессе тут очень много всего нужно настроить, удобно реализовать…
GRPO в процессе тут очень много всего нужно настроить, удобно реализовать поддержку своих ревард функций и возможность их удобно конструировать много разных…
- #5564Ну что континьюс претрейнинг для qwen-0.5B свежевыкачанного с HF поехал. Вроде…
Ну что континьюс претрейнинг для qwen-0.5B свежевыкачанного с HF поехал. Вроде круто
- #5563https://newsletter.semianalysis.com/p/rl-environments-and-rl-for-science
https://newsletter.semianalysis.com/p/rl-environments-and-rl-for-science