Google DeepMind представил Gemini 3.8 — новую модель синтеза речи с человеческой интонацией
Google DeepMind представила Gemini 3.8 Text-to-Speech — новую модель синтеза речи, которая, по заявлению разработчиков, способна генерировать голос с интонациями, тембром и ритмом, близкими к человеческим. Система работает в режиме zero-shot: ей не нужны предварительные записи голоса пользователя для настройки.
Модель поддерживает многоголосье — может имитировать разных дикторов в одном потоке, а также управлять темпом и эмоциональной окраской через текстовые промпты. DeepMind подчёркивает, что Gemini 3.8 TTS обучена на миллионах часов аудиоданных, но при этом не воспроизводит голоса конкретных людей без согласия.
Релиз ожидается в ближайшие недели через API Google Cloud. Пока доступен только текстовый анонс без открытого бенчмарка или демо. Это первый крупный шаг DeepMind в области синтеза речи после интеграции голосовых возможностей в Gemini 3.0 в прошлом году.