Голос из описания: Gradium запустил Voice Design и генерирует синтетических персонажей за секунды
Голосовым агентам вечно не хватает голоса в каталоге: вместо «квебекской администраторши для дилерского центра в Монреале» или «лектора под шестьдесят с авторитетом на всю аудиторию» приходится брать что-то похожее. Клонирование закрывает вопрос, но требует референс-аудио, согласия и лицензии. Gradium — парижская voice-компания, вышедшая из исследовательской лаборатории Kyutai, — решила пойти другим путём.
Voice Design принимает письменное описание голоса и возвращает готовых персонажей. Никаких референсов и разрешений: модель работает только с текстом. В описании можно указать пол, возраст, акцент, тембр, темп, энергию, манеру речи и даже задачу, для которой голос нужен — это влияет на подачу. Ввод — от 1 до 500 символов, поддерживаются английский, французский, испанский, португальский и немецкий. За один запрос приходят 1–5 кандидатов, обычно за 3–5 секунд.
Перейти от кандидатов к продакшену — четыре вызова API: генерация, проверка эмбеддингов, прослушивание через обычный TTS и закрепление голоса. У кандидатов есть ограничения: тестовая озвучка до 100 символов, только REST (без WebSocket и Speech-to-Speech), а через 30 дней они удаляются. Если голос понравился — конвертация бесплатная, но занимает один слот кастомных голосов (5 на бесплатном тарифе, 1000 на платных).
Ещё одна деталь: сэмплинг намеренно недетерминированный — команда сначала расширяет описание, и это расширение меняется от запроса к запросу, поэтому даже с одинаковым промптом и сидом голос получается другим.