небольшой апдейт. Есть спец сборка llama для архитектуры Pascal - так вот, производительность Qwen3 4B - около 50 т/с. Также я запустил на двух картах (P-104-100 у меня напоминаю есть, но если есть возможность лучше P-102-100) Qwen3.6-9B (модель Q4, кэш Q_8) с контекстом 250к (производительность 25-30т/с) - и он даже работал как агент вполне сносно, ну чаше ошибался, нужно было дергать его почаще (даже 4B модель работала с агентским контекстом (а он у меня 30к), в отличии от Гемма4 12b - которая отказывалась признавать себя агентом). Так что из говна и палок можно даже агента себе локального собрать. От Ornith 1.0 в итоге отказался (150т/с, без nvlink), Qwen3.6-27B (60т/с) пока самый топ из локальных. Жду выхода Qwen3.8 на HF прям.
небольшой апдейт. Есть спец сборка llama для архитектуры Pascal - так вот,…
0 viewsОткрыть в Telegram →
Из этого канала
- #6761Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning…
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning https://arxiv.org/abs/2607.07508 https://www.alphaxiv.org/ru/overview/2607.07508
- #6763https://github.com/NeoXider/CoreAI Сделал Фреймворк для агентных систем, в том…
https://github.com/NeoXider/CoreAI Сделал Фреймворк для агентных систем, в том числе для игр, рантайм изменения, скилы, тулколы.
- #6759SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning…
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning https://arxiv.org/abs/2607.14777 https://www.alphaxiv.org/ru/overview/2607.14777
- #6758ребятки кстати можете поскидывать проекты которыми занимаетесь и попиариться…
ребятки кстати можете поскидывать проекты которыми занимаетесь и попиариться здесь
- #6757https://www.reddit.com/r/HollowKnight/comments/1vh0nfp/hollowknightaireinforceme…
https://www.reddit.com/r/HollowKnight/comments/1vh0nfp/hollowknightaireinforcementlearningvshornet/ прикольно