Nano Banana для аудио
Tencent представили новую модель AuK для генерации и редактирования речи с мощными возможностями настройки голоса.
Nano Banana для аудио
Tencent выкатили AuK для генерации и редактирования речи. Это 1.5B модель, которая через один интерфейс превращает текст в речь и правит готовые записи по текстовой инструкции. Она клонирует голос по референсу, меняет слова без перезаписи всей фразы, убирает акцент и шум, крутит тембр, эмоцию, скорость и высоту, а ещё отделяет спикера или вокал от микса.
Обучали на 1.95 млн часов "эффективного обучающего аудио". Для понимания инструкций отдельно используется Qwen2.5-Omni-3B, поэтому 1.5B это не весь размер модели. Вместе с базовой версией выложили AuK-Flash. Она делает 4 шага вместо 32 и работает в 4.5 раза быстрее. Код, веса и ComfyUI-ноды уже можно покрутить руками.
Ссылки
Почему это важно
АналітикаЭта технология имеет потенциал значительно упростить процесс генерации и редактирования речи, что может быть полезно в различных областях, от медиа до образования.
Обсудить в сообществе
Діліться своїм досвідом та думками з ШІ-розробниками