Сравнение 7 API для клонирования голоса: 10 секунд записи, проверка согласия и цена за 1 млн символов
Voice cloning — это не просто сделать «хороший» голос, а сделать голос, который звучит как конкретный человек. Чтобы оценить, как с этим справляются провайдеры, взяли 10-секундный WAV-файл одного диктора в тихой комнате и прогнали через 7 платформ клонирования. Каждая читала одни и те же две фразы — одну разговорную, другую с числами и именем собственным. Использовали режим мгновенного клонирования с настройками по умолчанию.
Два сервиса немного нарушили условия теста. Hume требует минимум 15 секунд, поэтому его клон сделали на 15-секундной версии того же диктора. ElevenLabs рекомендует 1–2 минуты для Instant Voice Cloning, поэтому его результат получен с 10-секундным референсом — вопреки рекомендациям. Сравнение велось по четырём осям: минимальная длина референса, проверка согласия владельца голоса, коммерческая лицензия и количество поддерживаемых языков.
Выбор API зависит от задачи: если нужна максимальная похожесть — придётся мириться с длинными референсами, если важна скорость и простота — можно пожертвовать качеством. Обзор не называет победителя, но даёт послушать все образцы и принять решение самостоятельно.