"начал делать локальную студию для RLя (потому что все должны рлить) там добавлены сейчас 88 енвов, ерализованы многие популярные алгоритмы также алгоритмов добавлена память на LSTM/GRU есть селф-плей alphazero с несколькими средами есть возможность запускать несколько параллельных сред для одного эксперимента https://github.com/researchim-ai/reinforcement-studio пока что просто показываю. где-нибудь в конце этой недели или на следующей мб будет билд уже под linux/windows, чтобы можно было с кайфом потыкать в общем-то оно и сейчас работает вроде бы но надо потестить еще + некоторые фичи допиливаются вообще эта штука делается как ответвление моделек дома https://github.com/researchim-ai/models-at-home чисто под rl модельки дома тоже потихонечку переезжаются на свою прилу https://github.com/researchim-ai/models-at-home-studio я туда хотел запихнуть страницу с ""маленьким рлем"". но как будто тут отдельная штука нужна была ну и я решил делать в общей приле с ллмками/влмками и прочим рлю было бы тесно PS все проектики делаются тут https://t.me/researchim"
"начал делать локальную студию для RLя (потому что все должны рлить) там…
Из этого канала
- #1358еще квеновое приехало 125B A6B + 51B наверное как дипсик флеш должно быть по…
еще квеновое приехало 125B A6B + 51B наверное как дипсик флеш должно быть по уму. я попозже тоже попробую запустить…
- #1353Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же…
Буквально лучший поиск, один из самых быстрых дешвле соседей и с тем же качеством keenable.ai - юзать отсюда и всем по 100к бесплатных поисков на месяц релиза…
- #1351Q-Learning With World Models https://arxiv.org/abs/2608.17163…
Q-Learning With World Models https://arxiv.org/abs/2608.17163 https://www.alphaxiv.org/ru/abs/2608.17163
- #1350добавил в однокликового ресечагента qwen 3.8 27B моделька очень крутая но много…
добавил в однокликового ресечагента qwen 3.8 27B моделька очень крутая но много думает и говорят иногда может подчистить вам всю репу если кто хочет…