Модели и агенты
Alibaba выпустила Qwen Audio 3.1 с пятью моделями и обрушила цены на ИИ-аудио до 95%
Alibaba Qwen выпустила Qwen-Audio-3.1 — набор из пяти моделей для работы с аудио: распознавание речи (ASR), синтез текста в речь (TTS) и интерактивные сценарии. Новая ASR-модель улучшила поддержку многоязычности и диалектов, а также автоматически чистит слова-паразиты и повторы. Версия ASR-Next добавляет идентификацию нескольких говорящих с временными метками, распознаёт эмоции, фоновые звуки и шум оборудования.
TTS-модель поддерживает многоязычный синтез. Вместе с релизом Alibaba объявила о снижении цен на аудио-API до 95% — это делает сервис одним из самых дешёвых на рынке. Линейка нацелена как на разработчиков голосовых ассистентов, так и на корпоративные сценарии транскрибации и озвучки.
Источник: the-decoder.com