Ребят, у нас можно будет в GRPO алгоритмах собирать роллауты с отдельного vllm воркера Я на первой гпухе запустил GRPO, на второй модельку в вллм для сбора ролаутов тренируется лора и раз в несколько шагов эта лора апдейтится с тренируемой модельки в vllm