Недавно нужно было оптимизировать скорость выполнения разных LLM задачек —> что сработало: 1) Переход на модели поменьше - с подкручиванием промптов, в том числе сократить/выключить reasoning. Кстати, идеальная задача для /goal команды: просите крутить промпты, пока не получите оптимальное соотношение скорости и качества 2) Сократить обьем output, а потом и input токенов - более компактная структура, выкидывание ненужного 3) У gemini есть настройка приоритета; но вызов тогда стоит в ~2 раза дороже 4) Анализ использования кэша —> фикс промптов и последовательности подачи контекста P.S. Классические вещи типа параллелизации запросов я не покрываю тут; здесь скорее llm specific вещи