Бенчмарк TTFT для голосовых ИИ-агентов: почему первый токен — не главное
Время до первого токена (TTFT) — стандартная метрика для выбора API инференса, но для голосовых агентов она вводит в заблуждение. TTFT фиксирует момент начала генерации, но текст-в-речь (TTS) не может синтезировать полслова — ему нужна целая фраза. LiveKit вводит метрику time-to-first-sentence (TTFS): именно её пользователь ощущает как задержку. Таким образом, важны два параметра: TTFT (когда начинается генерация) и токенов в секунду (как быстро завершается первое предложение).
Разбор одного голосового цикла от LiveKit: STT — 100–200 мс, LLM — 300–500 мс (со стримингом), TTS — 100–200 мс, сеть — 50–150 мс (WebRTC). Целевая сквозная задержка — 700 мс до 1,2 с. Сооснователь Pipecat Kwindla Hultman Kramer называет 800 мс медианой, а 1 500 мс — приемлемым для прототипа. Естественная пауза в разговоре — около 500 мс; свыше 800 мс уже неестественна.
Бенчмарк Artificial Analysis тестирует провайдеров LLM с учётом пяти нюансов: форма входа (10k токенов, как в реальных агентах), расположение сервера (us-central1-a GCP), токены рассуждения (для reasoning-моделей — первый reasoning-токен), измерение от отправки запроса до первого полезного токена (не внутреннего), и нестабильность TTFT между запусками. Результаты — в таблице лидеров API-провайдеров.