From f(x) and g(x) to f(g(x)): LLMs Learn New Skills in RL by Composing Old Ones https://arxiv.org/abs/2509.25123 https://husky-morocco-f72.notion.site/From-f-x-and-g-x-to-f-g-x-LLMs-Learn-New-Skills-in-RL-by-Composing-Old-Ones-2499aba4486f802c8108e76a12af3020
From f(x) and g(x) to f(g(x)): LLMs Learn New Skills in RL by Composing Old…
0 viewsОткрыть в Telegram →
Из этого канала
- #4841EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement…
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning https://arxiv.org/abs/2509.22576…
- #4842https://hazyresearch.stanford.edu/blog/2025-09-22-pgl Все больше материала и…
https://hazyresearch.stanford.edu/blog/2025-09-22-pgl Все больше материала и наработок по теме NVLink NVSwitch
- #4843идеально конечно 32 VRAM, и не обязательно Nvidia
идеально конечно 32 VRAM, и не обязательно Nvidia
- #4839Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play…
Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play https://arxiv.org/abs/2509.25541 https://www.alphaxiv.org/ru/overview/2509.25541v1…
- #4838Language Models Can Learn from Verbal Feedback Without Scalar Rewards…
Language Models Can Learn from Verbal Feedback Without Scalar Rewards https://arxiv.org/abs/2509.22638 https://www.alphaxiv.org/ru/overview/2509.22638v1…