Волна ИИПодписаться
← Назад
Модели и агенты

Qwen-Audio-3.0-TTS: быстрый и качественный синтез речи от Alibaba — теперь с голосовым дизайном

20.07.2026 · marktechpost.com ↗

Alibaba Tongyi Lab представила Qwen-Audio-3.0-TTS — производственную систему текст-в-речь. Модель доступна в двух вариантах: Flash (с задержкой первого пакета ~300 мс) для интерактивных сценариев и Plus для высококачественной генерации с акцентом на естественность и точность тембра. Обе версии работают через двунаправленный WebSocket и доступны через Alibaba Cloud Model Studio (не как скачиваемые веса).

Технически модель использует низкочастотный токенизатор (12.5 Гц) для снижения затрат на авторегрессию, а обучение велось по пятиступенчатой схеме: независимый претрейнинг LM и FM, совместная дообучка с высококачественными данными, RL для LM, укрепление устойчивости FM и RL для FM. Это улучшило согласованность контента, естественность просодии, качество голоса и устойчивость к шумным референсным аудио. Qwen-Audio-3.0-TTS-Plus занял первое место в независимом рейтинге Artificial Analysis Text-to-Speech.

Модель поддерживает 16 языков, голосовое клонирование, дизайн голоса, управление стилем через инструкции и теги, а также однопроходную генерацию до 3 минут. API выводит аудио до 48 кГц в форматах PCM, WAV, MP3, Opus. DashScope SDK и примеры на Python, Java, Go, C#, PHP, Node.js доступны для регионов Сингапур и Пекин.

Источник: marktechpost.com
← Все новости AI Wave