Unlocking On-Policy Distillation for Any Model Family https://huggingface.co/spaces/HuggingFaceH4/on-policy-distillation https://huggingface.co/docs/trl/main/en/gold_trainer
Unlocking On-Policy Distillation for Any Model Family…
0 viewsОткрыть в Telegram →
Из этого канала
- #5007Transitive RL: Value Learning via Divide and Conquer…
Transitive RL: Value Learning via Divide and Conquer https://arxiv.org/abs/2510.22512 alphaxiv.org/overview/2510.22512v1…
- #5008Всем привет! Есть в чате те, кто использовал RL для файнтюна гиперпараметров…
Всем привет! Есть в чате те, кто использовал RL для файнтюна гиперпараметров классических моделей.
- #5009https://github.com/HKUDS/AI-Trader
https://github.com/HKUDS/AI-Trader
- #5005кстати, раз чел сделал покербатл, то захотелось сделать и проект для обучения…
кстати, раз чел сделал покербатл, то захотелось сделать и проект для обучения ллмок/рля карточным играм https://github.com/researchim-ai/card-games-env хочется…
- #5004https://cursor.com/blog/composer
https://cursor.com/blog/composer