No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping https://arxiv.org/abs/2509.21880
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement…
Из этого канала
- #4866ML-техлид (Motion Planning) Москва, офис team lead Наша команда отвечает за…
ML-техлид (Motion Planning) Москва, офис team lead Наша команда отвечает за мозг движения робота-доставщика: от понимания сцены и предсказания динамики до…
- #4867Привет! Хочу поделиться свежим проектом от Щи Продакшен — сегодня у нас релиз…
Привет! Хочу поделиться свежим проектом от Щи Продакшен — сегодня у нас релиз «Алтайский рубеж» 🚙🌄 Это открывающий ролик для Дилерского совета Авто.ру —…
- #4874Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning…
Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning https://arxiv.org/abs/2509.24372 https://www.alphaxiv.org/ru/overview/2509.24372v1
- #4864https://huggingface.co/datasets/revyu/financepostsruextracted делаю датасет для…
https://huggingface.co/datasets/revyu/financepostsruextracted делаю датасет для data mining финанс каналов плюс по жизни скучно ищу крутых чюваков
- #4863Physics of Learning: A Lagrangian perspective to different learning paradigms…
Physics of Learning: A Lagrangian perspective to different learning paradigms https://arxiv.org/abs/2509.21049 https://www.alphaxiv.org/ru/overview/2509.21049v1