Волна ИИПодписаться
← Назад
Модели и агенты

Google DeepMind представил Gemini 3.8 — новую модель синтеза речи с человеческой интонацией

23.09.2026 · deepmind.google ↗

Google DeepMind представила Gemini 3.8 Text-to-Speech — новую модель синтеза речи, которая, по заявлению разработчиков, способна генерировать голос с интонациями, тембром и ритмом, близкими к человеческим. Система работает в режиме zero-shot: ей не нужны предварительные записи голоса пользователя для настройки.

Модель поддерживает многоголосье — может имитировать разных дикторов в одном потоке, а также управлять темпом и эмоциональной окраской через текстовые промпты. DeepMind подчёркивает, что Gemini 3.8 TTS обучена на миллионах часов аудиоданных, но при этом не воспроизводит голоса конкретных людей без согласия.

Релиз ожидается в ближайшие недели через API Google Cloud. Пока доступен только текстовый анонс без открытого бенчмарка или демо. Это первый крупный шаг DeepMind в области синтеза речи после интеграции голосовых возможностей в Gemini 3.0 в прошлом году.

Источник: deepmind.google
← Все новости AI Wave