Полный пайплайн анализа звонков на локальной LLM без GPU: эксперимент от аудио до резюме
Автор проверил, как работает полный пайплайн анализа звонков на обычном компьютере без GPU. Приложение на Tauri, Rust, React и SQLite обрабатывает аудио: распознаёт речь, диаризирует спикеров, оценивает эмоции и риски, а финальное резюме и рекомендации генерирует локальная LLM. Интернет нужен только для первоначальной загрузки моделей.
В эксперименте использовались реальные записи телефонных разговоров с музыкой, автоответчиком, перебиваниями и плохим звуком. Сравнивались два распознавателя речи. Цель — понять, на каком этапе возникают основные проблемы: от аудио до итогового резюме.
Результаты показали, что качество распознавания сильно зависит от чистоты аудио, а ошибки на ранних этапах (диаризация, тональность) напрямую влияют на итоговое резюме. Приложение полностью локальное и может быть полезно для тех, кто хочет анализировать звонки без отправки данных в облако.