"Nano Banana для аудио Tencent выкатили AuK для генерации и редактирования речи. Это 1.5B модель, которая через один интерфейс превращает текст в речь и правит готовые записи по текстовой инструкции. Она клонирует голос по референсу, меняет слова без перезаписи всей фразы, убирает акцент и шум, крутит тембр, эмоцию, скорость и высоту, а ещё отделяет спикера или вокал от микса. Обучали на 1.95 млн часов ""эффективного обучающего аудио"". Для понимания инструкций отдельно используется Qwen2.5-Omni-3B, поэтому 1.5B это не весь размер модели. Вместе с базовой версией выложили AuK-Flash. Она делает 4 шага вместо 32 и работает в 4.5 раза быстрее. Код, веса и ComfyUI-ноды уже можно покрутить руками. Демо Код Веса @ai_newz"