после еще тестов добавляем unsloth для всех стадий + в grpo хочу енвайронменты завозить https://github.com/researchim-ai/re-rl вот это наш же для генерации данных для математики (хотя наверное пока енвайроменты немного подождут, есть поприоритетнее штуки, попозже распишу)