"Nano Banana для аудио Tencent выкатили AuK для генерации и редактирования речи. Это 1.5B модель, которая через один интерфейс превращает текст в речь и правит готовые записи по текстовой инструкции. Она клонирует голос по референсу, меняет слова без перезаписи всей фразы, убирает акцент и шум, крутит тембр, эмоцию, скорость и высоту, а ещё отделяет спикера или вокал от микса. Обучали на 1.95 млн часов ""эффективного обучающего аудио"". Для понимания инструкций отдельно используется Qwen2.5-Omni-3B, поэтому 1.5B это не весь размер модели. Вместе с базовой версией выложили AuK-Flash. Она делает 4 шага вместо 32 и работает в 4.5 раза быстрее. Код, веса и ComfyUI-ноды уже можно покрутить руками. Демо Код Веса @ai_newz"
"Nano Banana для аудио Tencent выкатили AuK для генерации и редактирования…
Из этого канала
- #4756Сбер выпустил GigaChat 3.5 Reasoning - обученную с нуля модель с рассуждениями…
Сбер выпустил GigaChat 3.5 Reasoning - обученную с нуля модель с рассуждениями Веса открыты, лежат на Hugging Face, модель можно использовать в коммерческих…
- #4757Krea Agents Krea собрали среду с тул-юзом для скиллов и пайплайнов. Главная…
Krea Agents Krea собрали среду с тул-юзом для скиллов и пайплайнов. Главная фича тут файловая система.
- #4754Practical ML Conf 2026 Продолжаем вести неофициальный календарь ML-конференций.…
Practical ML Conf 2026 Продолжаем вести неофициальный календарь ML-конференций. Следующая заметная дата — 19 сентября, когда пройдёт Practical ML Conf.
- #4753Интересная инфографика от Epoch, показывающий насколько быстро растёт компьют…
Интересная инфографика от Epoch, показывающий насколько быстро растёт компьют используемый большим лабам.
- #4749Ситуация на image арене с выходом GPT-Image-2.5 Есть две версии модели…
Ситуация на image арене с выходом GPT-Image-2.5 Есть две версии модели GPT-Image-2.5: Flare и Sunburst.