После неожиданного context overflow примерно через 4 часа моего 8-часового прогона я всё-таки закончил эксперимент и потом разобрал логи за оба запуска - примерно 4 + 4 часа. Результат меня реально удивил: 27 попыток compaction, только 5 успешных, 22 failed. На одни compaction ушло около 137 минут, плюс DSH некорректно учитывал часть токенов compaction/ retry, то есть реальный API usage может быть выше того, что показывает UI. В итоге я воспроизвёл баги, сделал и провалидировал fix и выложил его в свой fork: https://github.com/vpimshin/deepseek-harness/commit/b4bbea2 Пока мой вывод: DSH + платный API/ GPU для длинных autonomous runs сейчас выглядит очень неэффективно по токенам и времени. Хорошо, что я сначала прогнал это на локальной модели, до подключения OpenAI Luna API/ rented GPU.
После неожиданного context overflow примерно через 4 часа моего 8-часового…
0 viewsОткрыть в Telegram →
Из этого канала
- #6954классическая проблема с headroom , для Llama.cpp и подобных с long context…
классическая проблема с headroom , для Llama.cpp и подобных с long context лучше сразу делать headless inference на отдельном GPU, чтобы UI не мешало.
- #6952https://www.reddit.com/r/LocalLLaMA/s/NgUZR5of5c
https://www.reddit.com/r/LocalLLaMA/s/NgUZR5of5c
- #6949https://github.com/researchim-ai/reinforcement-studio звездочек завезите кому…
https://github.com/researchim-ai/reinforcement-studio звездочек завезите кому по кайфу)