Веб-интерфейс для Gemini 3.8 Live: голосовое общение через браузер с возможностью прерывания
Google выпустила Gemini 3.8 Live и 3.8 Live Extended Thinking — две новые модели, которые преобразуют речь в речь в реальном времени, аналогично семейству GPT-Live от OpenAI. Разработчик Simon Willison оперативно создал веб-интерфейс для их тестирования.
Интерфейс позволяет выбрать модель и голосовой пресет, задать системный промпт и начать голосовой разговор прямо в браузере. Ключевая фича — возможность прерывать модель, пока она говорит. Реализация использует WebSocket-эндпоинт wss://generativelanguage.googleapis.com/ws/... и Web Audio API для захвата и воспроизведения звука — без единой библиотеки.
Для тех, кто хочет повторить, Google опубликовала туториал по работе с WebSockets API Gemini Live. Это отличный способ попробовать новые голосовые возможности без установки приложений.