Собрал заметку про оптимизацию расходов на Vertex AI (Gemini). Если кто строит на Gemini, там есть три рычага которые складываются вместе и режут счет на 70-95%. Что я успешно и воплатил в реальности. Explicit caching: сохраняете префикс промпта на стороне Google, получаете 90% скидку на эти токены. Кэшируемая часть промта может находиться где угодно, их даже может быть несколько в разных местах. Но очень важно - Google потом их все объединяет в один. Поэтому, лучше комбинировать это с implicit caching. Это самый надежный способ. То есть кешируемая часть целиком вся находится вверху и еще имеет разметку характерную для explicit caching. Implicit caching: бесплатный, но ненадежный. Работает когда ставите статическую часть промпта наверх. Срабатывает через раз. Flex PayGo: реал-тайм запросы со скидкой 50% на всё. Задержка до 15 мин, для фоновых задач огонь. Главное: Flex работает вместе с кэшем. Кэшированные токены стоят $0.015/M вместо $0.30/M. 95% скидка на префикс. А Batch (асинхронный) с кэшем вообще не дружит. Если у вас длинный общий префикс, Batch дороже чем Flex + кэш. Подробности в файле. Может, все и так уже этим пользовались, но вдруг кому-то окажется полезно. Основная идея - ставить повторяющуюся часть промта наверх, а input variables - вниз и также пользоваться explicit caching вместе с этим.
Собрал заметку про оптимизацию расходов на Vertex AI (Gemini). Если кто строит…
Источник
https://t.me/vsevolodustinovchannel/3124Канал Всеволод Устинов (канал: ai, стартапы, пост-ирония) · опубликовано 11 авг. 2026 г.
Из этого канала
- #3123Макс Красных (фаундер Mokka, AI assistant for recruiters) делится полезным про…
Макс Красных (фаундер Mokka, AI assistant for recruiters) делится полезным про оптимизацию костов на токены для ai продуктов
- #3122Прочитал пару пейперов о влиянии ИИ на рынок труда, пока наблюдается такая…
Прочитал пару пейперов о влиянии ИИ на рынок труда, пока наблюдается такая картина: 1.
- #3121Совпадает с моими наблюдениями
Совпадает с моими наблюдениями