классическая проблема с headroom , для Llama.cpp и подобных с long context лучше сразу делать headless inference на отдельном GPU, чтобы UI не мешало. Контекстная деградация тоже известный паттерн, 2x падение при 90%+ заполнении это ещё нормально, дальше вообще может начать thrash. Для таких задач правильный подход , отдельный GPU-инстанс под инференс, а не пытаться уместить всё на одном десктопном железе. На regcloud есть почасовые GPU-инстансы (A100/A10), которые можно держать только на время inference-сессии и не переплачивать за idle. JupyterHub там тоже из коробки есть, удобно для экспериментов с RAG/papers , развернул, погонял бенчмарк, отдал инстанс
классическая проблема с headroom , для Llama.cpp и подобных с long context…
0 viewsОткрыть в Telegram →
Из этого канала
- #6955После неожиданного context overflow примерно через 4 часа моего 8-часового…
После неожиданного context overflow примерно через 4 часа моего 8-часового прогона я всё-таки закончил эксперимент и потом разобрал логи за оба запуска -…
- #6952https://www.reddit.com/r/LocalLLaMA/s/NgUZR5of5c
https://www.reddit.com/r/LocalLLaMA/s/NgUZR5of5c
- #6949https://github.com/researchim-ai/reinforcement-studio звездочек завезите кому…
https://github.com/researchim-ai/reinforcement-studio звездочек завезите кому по кайфу)
- #6948в конце недели или на следующей уже буду билдик готовить
в конце недели или на следующей уже буду билдик готовить