небольшой апдейт. Есть спец сборка llama для архитектуры Pascal - так вот, производительность Qwen3 4B - около 50 т/с. Также я запустил на двух картах (P-104-100 у меня напоминаю есть, но если есть возможность лучше P-102-100) Qwen3.6-9B (модель Q4, кэш Q_8) с контекстом 250к (производительность 25-30т/с) - и он даже работал как агент вполне сносно, ну чаше ошибался, нужно было дергать его почаще (даже 4B модель работала с агентским контекстом (а он у меня 30к), в отличии от Гемма4 12b - которая отказывалась признавать себя агентом). Так что из говна и палок можно даже агента себе локального собрать. От Ornith 1.0 в итоге отказался (150т/с, без nvlink), Qwen3.6-27B (60т/с) пока самый топ из локальных. Жду выхода Qwen3.8 на HF прям.