Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах нуи в целом схема как там устроено все на скрине, прикольно Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report https://arxiv.org/abs/2608.15763 https://www.alphaxiv.org/ru/abs/2608.15763
Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах…
Из этого канала
- #1367Квены потренили Qwen 3.5 4B для автопилота, только добавили к нему голову в…
Квены потренили Qwen 3.5 4B для автопилота, только добавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) + добавлен planning expert…
- #1366Пока ходил искал алгоритмы которые в студию завести полезно собрал список Zero…
Пока ходил искал алгоритмы которые в студию завести полезно собрал список Zero алгоритмов Mastering Chess and Shogi by Self-Play with a General Reinforcement…
- #1364Небольшой апдейт по студии…
Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio туда добавлены некоторые multi agent rl алгоритмы world models и алгоритмы…