кстати, раз чел сделал покербатл, то захотелось сделать и проект для обучения ллмок/рля карточным играм https://github.com/researchim-ai/card-games-env хочется и ллмы и влмки учить. графика позже заедет
кстати, раз чел сделал покербатл, то захотелось сделать и проект для обучения…
0 viewsОткрыть в Telegram →
Из этого канала
- #5006Unlocking On-Policy Distillation for Any Model Family…
Unlocking On-Policy Distillation for Any Model Family https://huggingface.co/spaces/HuggingFaceH4/on-policy-distillation…
- #5007Transitive RL: Value Learning via Divide and Conquer…
Transitive RL: Value Learning via Divide and Conquer https://arxiv.org/abs/2510.22512 alphaxiv.org/overview/2510.22512v1…
- #5008Всем привет! Есть в чате те, кто использовал RL для файнтюна гиперпараметров…
Всем привет! Есть в чате те, кто использовал RL для файнтюна гиперпараметров классических моделей.
- #5004https://cursor.com/blog/composer
https://cursor.com/blog/composer
- #5003Critique-RL: Training Language Models for Critiquing through Two-Stage…
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning https://arxiv.org/abs/2510.24320…