Saaras V4: speech-to-text модель Sarvam AI для всех 22 языков Индии и английского
Saaras V4 — это encoder-decoder архитектура: аудиоэнкодер преобразует сигнал в эмбеддинги, temporal-downsampling адаптер сжимает последовательность, а декодер Sarvam-3B (гибридная state-space модель на 3 млрд параметров) генерирует транскрипцию авторегрессивно. Модель доступна через API Sarvam (model="saaras:v4"), веса не публичны, self-hosting пока только для v3.
На бенчмарках Saaras V4 показывает лучший средний WER среди протестированных моделей на английских датасетах (AMI, GigaSpeech, LibriSpeech и др.) и на индийском Vistaar. На зашумлённом Kathbath Noisy ошибка менее половины от Deepgram Nova-3 и GPT-4o Transcribe. Ошибка определения языка — 2.9% для топ-10 языков, 5.22% для всех 22. Все результаты заявлены разработчиком, независимое воспроизведение не опубликовано.
Одна модель умеет выдавать 5 вариантов транскрипции через параметр mode: transcribe (родной алфавит с нормализацией), verbatim (дословно), codemix (родной алфавит, английские слова латиницей), translit (полная латиница) и translate (перевод на английский). Новая фича V4 — keyterm prompting: до 50 ключевых слов (до 64 символов) для смещения распознавания. В режиме codemix бренды вроде PhonePe остаются латиницей.
Цена: ₹30 за час для real-time, streaming и batch, ₹45 с диаризацией. Поддерживаются WebSocket (первые токены менее 150 мс), REST до 30 секунд, batch до 2 часов. SDK для Python, Node.js, интеграции с LiveKit, Pipecat и Vercel AI SDK. Переход с v3 — замена одной строки в запросе.