Ребят, у нас можно будет в GRPO алгоритмах собирать роллауты с отдельного vllm воркера Я на первой гпухе запустил GRPO, на второй модельку в вллм для сбора ролаутов тренируется лора и раз в несколько шагов эта лора апдейтится с тренируемой модельки в vllm
Ребят, у нас можно будет в GRPO алгоритмах собирать роллауты с отдельного vllm…
0 viewsОткрыть в Telegram →
Из этого канала
- #5627Круто! А реварды ты придумал как кастомизировать?
Круто! А реварды ты придумал как кастомизировать?
- #5628сделан базовый конструктор сейчас) но я думаю что еще буду работать над ним.…
сделан базовый конструктор сейчас) но я думаю что еще буду работать над ним. надо суперудобно сделать)
- #5629У меня в либе можно было класс отзаимствовать И написать метод с расчетом…
У меня в либе можно было класс отзаимствовать И написать метод с расчетом реварда, что-то такое я делал, вроде Как вариант)
- #5623On neural scaling and the quanta hypothesis https://ericjmichaud.com/quanta/
On neural scaling and the quanta hypothesis https://ericjmichaud.com/quanta/
- #5622у нас есть grpo, dr.grpo и dapo по-дефолту будет grpo все же
у нас есть grpo, dr.grpo и dapo по-дефолту будет grpo все же