Defeating the Training-Inference Mismatch via FP16 https://arxiv.org/abs/2510.26788 https://www.alphaxiv.org/ru/overview/2510.26788v1 https://github.com/sail-sg/Precision-RL
Defeating the Training-Inference Mismatch via FP16…
0 viewsОткрыть в Telegram →
Из этого канала
- #5053Language Models are Injective and Hence Invertible…
Language Models are Injective and Hence Invertible https://www.arxiv.org/abs/2510.15511 https://www.alphaxiv.org/overview/2510.15511v3
- #5054https://github.com/Open-Dev-Society/OpenStock
https://github.com/Open-Dev-Society/OpenStock
- #5063MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End…
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning https://arxiv.org/abs/2511.02805
- #5048Нутк всё точно также, только нужно железо помощнее
Нутк всё точно также, только нужно железо помощнее
- #5045ну она не так уж и глубокая, я имею ввиду более экстремальные варианты
ну она не так уж и глубокая, я имею ввиду более экстремальные варианты