Собрал заметку про оптимизацию расходов на Vertex AI (Gemini). Если кто строит на Gemini, там есть три рычага которые складываются вместе и режут счет на 70-95%. Что я успешно и воплатил в реальности. Explicit caching: сохраняете префикс промпта на стороне Google, получаете 90% скидку на эти токены. Кэшируемая часть промта может находиться где угодно, их даже может быть несколько в разных местах. Но очень важно - Google потом их все объединяет в один. Поэтому, лучше комбинировать это с implicit caching. Это самый надежный способ. То есть кешируемая часть целиком вся находится вверху и еще имеет разметку характерную для explicit caching. Implicit caching: бесплатный, но ненадежный. Работает когда ставите статическую часть промпта наверх. Срабатывает через раз. Flex PayGo: реал-тайм запросы со скидкой 50% на всё. Задержка до 15 мин, для фоновых задач огонь. Главное: Flex работает вместе с кэшем. Кэшированные токены стоят $0.015/M вместо $0.30/M. 95% скидка на префикс. А Batch (асинхронный) с кэшем вообще не дружит. Если у вас длинный общий префикс, Batch дороже чем Flex + кэш. Подробности в файле. Может, все и так уже этим пользовались, но вдруг кому-то окажется полезно. Основная идея - ставить повторяющуюся часть промта наверх, а input variables - вниз и также пользоваться explicit caching вместе с этим.