я вот юзаю опенклау. С дипсик работает отлично, подключал МиМо - часто возникает ошибка контекста - и запускается процесс компакции контекста (именно ошибка, опенклау неправильно считает). ТАк же использовал с опенклау локальные модели. Самая стабильная vLLM с QWen3/6-27B была, и работала модель очень хорошо, но на моем железе контекст только 130к был - это очень мало для агента. Так же пробовал llama - ошибка tool calls постоянно с любыми моделями, ollama - вполне норм, но нет поддержки MTP для Квенов, использовал Ornith 1.0 (MoE модель 35B на базе архитектуры квен) - хорошая скорость, неплохое качество - но до уровня 27B модели не дотягивает немного. Так же пробовал новую (недавно гугл обновил) Gemma4 31B В MTP режиме на Ollama - какой-то ужас. Модель прям не ахти. Скорость была хорошая. В ответах рассказывает истории, много не нужной инфы - вместо действий. (это всё с одним и тем же агентским контекстом). К опенклау надо нормальную векторную память прикручивать - по умолчанию там файловая - скажем так - не очень вариант. Сейчас вот хочу SGlang попробовать. Хочется всё таки иметь локальную модель Qwen3.6-27B с нормальным контекстом (250к) и MTP активным. Также инсайт, так сказать, недавно был. Майнинговые P-104-100 8Gb - есть поддержка в Ollama - можно спокойно заускать небольшие модельки для несложных задач (распознавание голоса, визион, написание несложного кода (задачи ставит большая модель), OCR и т.д. У меня этих карт полно просто)) И можно мелкие задачи делегировать этим моделькам - экономить токены/время большой модели Update. В итоге вернулся на vLLM - подобрал правильную модель и квантовании kv-кэша