Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing https://arxiv.org/abs/2509.08721 https://www.alphaxiv.org/overview/2509.08721v1
Sharing is Caring: Efficient LM Post-Training with Collective RL Experience…
0 viewsОткрыть в Telegram →
Из этого канала
- #4755AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through…
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning https://arxiv.org/abs/2509.08755…
- #4757Physics Supernova: AI Agent Matches Elite Gold Medalists at IPhO 2025…
Physics Supernova: AI Agent Matches Elite Gold Medalists at IPhO 2025 https://arxiv.org/abs/2509.01659
- #4759Вот такой RAG реализовал по работе. Каких-то теоретических изысканий по этой…
Вот такой RAG реализовал по работе. Каких-то теоретических изысканий по этой схеме не делал. На практике, работает вполне пристойно.
- #4752A Survey of Reinforcement Learning for Large Reasoning Models…
A Survey of Reinforcement Learning for Large Reasoning Models https://arxiv.org/abs/2509.08827 https://www.alphaxiv.org/ru/overview/2509.08827v1…
- #4749"Готовая к использованию настраиваемая мультиагентная AI-система с интеграцией…
"Готовая к использованию настраиваемая мультиагентная AI-система с интеграцией в Telegram.