SpaceXAI представила Grok Voice Transcribe 2.0: вдвое точнее и по $0,10/час
SpaceXAI анонсировала Grok Voice Transcribe 2.0 — новую версию своей модели преобразования речи в текст (STT). Разработчики утверждают, что точность выросла вдвое по сравнению с первой версией, при этом стоимость осталась на уровне $0,10 за час обработанного аудио. Модель специально обучали на сложных случаях: шумные телефонные линии, перебивающие друг друга голоса, региональные акценты и продиктованные пароли или номера.
Модель доступна как хостинговый API в пакетном и потоковом режиме, идентификатор — grok-voice-transcribe-2.0. SpaceXAI не раскрывает веса модели, поэтому самостоятельное развёртывание невозможно. Компания утверждает, что модель заняла первое место среди 33 потоковых моделей в публичном лидерборде Artificial Analysis (AA-WER Streaming, ~8 часов аудио), а также показывает снижение частоты ошибок (WER) на четырёх внутренних наборах данных: телефонные звонки, диалоги с Grok, произнесённые учётные данные и короткие фразы на 19 языках.
Особый упор сделан на мультиязычность: модель распознаёт десятки языков, автоматически определяет язык и может переключаться между ними в середине записи. Разработчики называют это главным улучшением по сравнению с 1.0. Например, на коротких командах (вроде голосовых запросов в автомобиле) WER упал с 20,6% до 6,8%, то есть на 67% меньше ошибок. Поддерживается форматирование чисел, валют и единиц измерения для 25 языков.
Публичные бенчмарки — vendor-reported, то есть заявлены самой компанией и не были независимо воспроизведены. Тем не менее, модель уже используется в продакшене: Grok Voice обрабатывает десятки тысяч звонков в поддержку ежедневно, транскрибирует миллионы часов видео и работает в голосовом ассистенте Tesla.