Learning to Reason as Action Abstractions with Scalable Mid-Training RL https://arxiv.org/abs/2509.25810 https://www.alphaxiv.org/ru/overview/2509.25810v1