я вот юзаю опенклау. С дипсик работает отлично, подключал МиМо - часто возникает ошибка контекста - и запускается процесс компакции контекста (именно ошибка, опенклау неправильно считает). ТАк же использовал с опенклау локальные модели. Самая стабильная vLLM с QWen3/6-27B была, и работала модель очень хорошо, но на моем железе контекст только 130к был - это очень мало для агента. Так же пробовал llama - ошибка tool calls постоянно с любыми моделями, ollama - вполне норм, но нет поддержки MTP для Квенов, использовал Ornith 1.0 (MoE модель 35B на базе архитектуры квен) - хорошая скорость, неплохое качество - но до уровня 27B модели не дотягивает немного. Так же пробовал новую (недавно гугл обновил) Gemma4 31B В MTP режиме на Ollama - какой-то ужас. Модель прям не ахти. Скорость была хорошая. В ответах рассказывает истории, много не нужной инфы - вместо действий. (это всё с одним и тем же агентским контекстом). К опенклау надо нормальную векторную память прикручивать - по умолчанию там файловая - скажем так - не очень вариант. Сейчас вот хочу SGlang попробовать. Хочется всё таки иметь локальную модель Qwen3.6-27B с нормальным контекстом (250к) и MTP активным. Также инсайт, так сказать, недавно был. Майнинговые P-104-100 8Gb - есть поддержка в Ollama - можно спокойно заускать небольшие модельки для несложных задач (распознавание голоса, визион, написание несложного кода (задачи ставит большая модель), OCR и т.д. У меня этих карт полно просто)) И можно мелкие задачи делегировать этим моделькам - экономить токены/время большой модели Update. В итоге вернулся на vLLM - подобрал правильную модель и квантовании kv-кэша
я вот юзаю опенклау. С дипсик работает отлично, подключал МиМо - часто…
0 viewsОткрыть в Telegram →
Из этого канала
- #6703добавил еще чтобы отобранные источники по которым отчет будет делаться тоже…
добавил еще чтобы отобранные источники по которым отчет будет делаться тоже были на странице на которой состояние текущего исследования отображается было.
- #6704Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel…
Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation https://arxiv.org/abs/2607.20908v1…
- #6705TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with…
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM https://arxiv.org/abs/2607.27205…
- #6701https://huggingface.co/blog/agent-intrusion-technical-timeline
https://huggingface.co/blog/agent-intrusion-technical-timeline
- #6700Кстати мои хорошие делитесь какими проектами сейчас занимаетесь, интересно…
Кстати мои хорошие делитесь какими проектами сейчас занимаетесь, интересно посмотреть