https://newsletter.semianalysis.com/p/rl-environments-and-rl-for-science
https://newsletter.semianalysis.com/p/rl-environments-and-rl-for-science
0 viewsОткрыть в Telegram →
Из этого канала
- #5564Ну что континьюс претрейнинг для qwen-0.5B свежевыкачанного с HF поехал. Вроде…
Ну что континьюс претрейнинг для qwen-0.5B свежевыкачанного с HF поехал. Вроде круто
- #5565Scaling Open-Ended Reasoning to Predict the Future…
Scaling Open-Ended Reasoning to Predict the Future https://www.arxiv.org/abs/2512.25070 https://www.alphaxiv.org/ru/overview/2512.25070…
- #5566DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement…
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning https://arxiv.org/abs/2501.12948v2 4 числа апдейтнули 22 -> 86 страниц
- #5562Всем привет, желаю чату бесконечных открытий в Новом Году! Ищу…
Всем привет, желаю чату бесконечных открытий в Новом Году! Ищу co-founder/technical partner (full-stack) Проект: B2B AI-решения, агентные системы,…
- #5560вкладка для загрузки уже претрененых моделек для последующего континуал…
вкладка для загрузки уже претрененых моделек для последующего континуал претрена/sft (и потом рля) в процессе