Недавно нужно было оптимизировать скорость выполнения разных LLM задачек —> что сработало: 1) Переход на модели поменьше - с подкручиванием промптов, в том числе сократить/выключить reasoning. Кстати, идеальная задача для /goal команды: просите крутить промпты, пока не получите оптимальное соотношение скорости и качества 2) Сократить обьем output, а потом и input токенов - более компактная структура, выкидывание ненужного 3) У gemini есть настройка приоритета; но вызов тогда стоит в ~2 раза дороже 4) Анализ использования кэша —> фикс промптов и последовательности подачи контекста P.S. Классические вещи типа параллелизации запросов я не покрываю тут; здесь скорее llm specific вещи
Недавно нужно было оптимизировать скорость выполнения разных LLM задачек —> что…
Из этого канала
- #1788выложили запись вебинара: https://youtu.be/YGZNrfBkDA
выложили запись вебинара: https://youtu.be/YGZNrfBkDA
- #1786"В последнее время все актуальнее вопрос: а может перейти на open source модель…
"В последнее время все актуальнее вопрос: а может перейти на open source модель и снизить зависимость/убрать риски, ну или сэкономить —> сделал для вас скилл…
- #1785Про применение AI в продуктовой аналитике - запускаю AI Product Analyst в…
Про применение AI в продуктовой аналитике - запускаю AI Product Analyst в августе: 1) как искать узкие места в продукте на пару с дружбаном, при этом не попав…