Как ускорить Whisper в 4 раза на CPU: разбор оптимизаций и подводных камней
Разработчик показал, как заставить модель Whisper распознавать голос почти в 4 раза быстрее на обычном CPU, полностью локально и без облачных сервисов. В основе ускорения — несколько оптимизаций: сужение окна энкодера (чтобы модель обрабатывала меньше данных), потоковая обработка аудио (без ожидания полной загрузки) и замена стандартного Whisper на faster-whisper — более производительную реализацию.
Особое внимание уделено подводным камням WinAPI: работа с аудиозахватом в Windows требует аккуратной обработки буферов и таймингов, иначе ускорение нивелируется задержками. В итоге решение позволяет получать субтитры или команды голосом в реальном времени на обычном ноутбуке, что открывает путь к офлайн-ассистентам без привязки к интернету и дорогим GPU.