чатгпт сделал нам отличную шпору по рлю. изучаем На английском конечно же намного лучше получается Агрея, стодание, полеход - каждый должен знать, это база
чатгпт сделал нам отличную шпору по рлю. изучаем На английском конечно же…
Из этого канала
- #1003Кстати листик с MCP серверами, думаю пригодятся…
Кстати листик с MCP серверами, думаю пригодятся https://github.com/punkpeye/awesome-mcp-servers
- #1004Коротенькая выжимка на английском по отличиям обжективов в алгоритмах…
Коротенькая выжимка на английском по отличиям обжективов в алгоритмах REINFORCE, ReMax, RLOO, PPO, GRPO, Dr.
- #1005Здесь автор пилит UI-шку для экспериментов с обычным рлем…
Здесь автор пилит UI-шку для экспериментов с обычным рлем https://github.com/dvalenciar/ReinforceUI-Studio дока тут https://docs.reinforceui-studio.com/welcome…
- #1001Тут автор рассказывает про свои эксперименты с ллм и GRPO для улучшения…
Тут автор рассказывает про свои эксперименты с ллм и GRPO для улучшения алгоритмов сортировки…
- #1000Вышла вторая версия овервьюшки по RL (современному), теперь 177 страничек (было…
Вышла вторая версия овервьюшки по RL (современному), теперь 177 страничек (было 144) Reinforcement Learning: A Comprehensive Overview…