классическая проблема с headroom , для Llama.cpp и подобных с long context лучше сразу делать headless inference на отдельном GPU, чтобы UI не мешало. Контекстная деградация тоже известный паттерн, 2x падение при 90%+ заполнении это ещё нормально, дальше вообще может начать thrash. Для таких задач правильный подход , отдельный GPU-инстанс под инференс, а не пытаться уместить всё на одном десктопном железе. На regcloud есть почасовые GPU-инстансы (A100/A10), которые можно держать только на время inference-сессии и не переплачивать за idle. JupyterHub там тоже из коробки есть, удобно для экспериментов с RAG/papers , развернул, погонял бенчмарк, отдал инстанс