Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation https://arxiv.org/abs/2509.25849 https://www.alphaxiv.org/ru/overview/2509.25849v1
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation…
0 viewsОткрыть в Telegram →
Из этого канала
- #4857Конфа про AI кодинг ассистенты и будущее разработки: https://www.ai-dev.live/
Конфа про AI кодинг ассистенты и будущее разработки: https://www.ai-dev.live/
- #4858RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems…
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems https://arxiv.org/abs/2510.02263 https://www.alphaxiv.org/ru/overview/2510.02263v1…
- #4862Why Can't Transformers Learn Multiplication? Reverse-Engineering Reveals…
Why Can't Transformers Learn Multiplication? Reverse-Engineering Reveals Long-Range Dependency Pitfalls https://arxiv.org/abs/2510.00184…
- #4851GEM: A Gym for Agentic LLMs https://arxiv.org/abs/2510.01051
GEM: A Gym for Agentic LLMs https://arxiv.org/abs/2510.01051
- #4850A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning…
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning https://arxiv.org/abs/2510.01132 https://www.alphaxiv.org/ru/overview/2510.01132v1…