DSH, день 2, словил сразу несколько ошибок: 1. GPU/X freeze 8 сек. Выкрутил inference почти на 100% GPU на той же карте, которая держит desktop. Получил NVIDIA watchdog / CUDA timeout, X завис примерно на 8 секунд, `llama.cpp` потерял CUDA-контекст. Т.е. из-за того что GPU жестко ушла под 100%, GUI повис на 8 сек, ubuntu дропнула процесс llama.cpp Вывод: нужен compute/power headroom, а ещё лучше - headless inference без GUI на этой GPU 2. Context нельзя использовать до 100%. Физический лимит был `131072`, Harness дошёл до `131095` и упал. Compaction уже не смог спасти сессию. → DSH ставлю ~125K при физических 131K + раньше compact/ handoff. Т.е. Harness не умеет предсказывать переполнение контекста, обычно делает auto-compact при 80%+ контекста, thresholdRatio: 0.8 (можно настраивать под каждую модель и работает очень стабильно), но если таска была c большим ризонингом (а Qwen3.8 ппц болтливый), она случайно может перелететь лимит 3. NVIDIA stack должен совпадать целиком. Получил kernel module `595.71.05` + userspace `595.84` → API mismatch и нестабильную CUDA → исправлено: kernel 7.0.0-30 + NVIDIA 595.84 везде 4. Long run должен быть restartable. Workspace - состояние на диске, session log/checkpoints - страховка. После reboot Harness реально продолжил работу. 5. Лучше NP1. Один агент → один inference slot. Несколько проектов лучше гонять последовательно. Следующий эксперимент: завершить всё тот же ~8h autonomous task, но теперь добавляю сравнение 1) GPT-5.6 Sol vs GPT-5.6 Luna + DSH vs просто GPT-5.6 Luna vs Qwen3.8-27B + DSH + сравнение качества, времени, токенов и стоимости Ещё по мои замерам, скорость падает до 2х при заполнении контекста под 100%: 0–10% ctx: ~49–53 tok/s → 25% ctx: ~40–45 tps → 50% ctx: ~33–38 tps → 75% ctx: ~29–31 tps → 85% (105K): ~28 tps → 90%+: ~25–28 tps
DSH, день 2, словил сразу несколько ошибок: 1. GPU/X freeze 8 сек. Выкрутил…
0 viewsОткрыть в Telegram →
Из этого канала
- #6945Ещё по мои замерам, скорость падает до 2х при заполнении контекста под 100%:…
Ещё по мои замерам, скорость падает до 2х при заполнении контекста под 100%: 0–10% ctx: ~49–53 tok/s → 25% ctx: ~40–45 tps → 50% ctx: ~33–38 tps → 75% ctx:…
- #6946А задача для DeepSeek Harness как раз long-run research, бегать по papers с…
А задача для DeepSeek Harness как раз long-run research, бегать по papers с подключенными скиллами и собирать стенд для тестирования нескольких гипотез
- #6947ну вроде готово) 50 минут со всякими фреймстеками и преобразованиями +…
ну вроде готово) 50 минут со всякими фреймстеками и преобразованиями + модифицированный ppo без памяти
- #6940я про архитектуру сеточки, которую учишь)
я про архитектуру сеточки, которую учишь)
- #6939пока ищу) если ты про то какую добавлять буду
пока ищу) если ты про то какую добавлять буду