MSEB от Google Research: гайд по бенчмарку звуковых эмбеддингов с кодом
MSEB (Massive Sound Embedding Benchmark) от Google Research — это бенчмарк для тестирования звуковых эмбеддингов. Он состоит из трёх слоёв: типы (Sound, SoundEmbedding, Score), контракт для кодировщиков (MultiModalEncoder) и набор оценщиков (evaluators) для разных задач. В статье разбирается, как установить пакет mseb и написать свои кодировщики, используя абстрактный базовый класс.
Авторы создали два простых кодировщика: один измеряет громкость во времени, другой — тембр. Затем они прогнали синтетический корпус через оценщики классификации, кластеризации, поиска и сегментации. Результаты показали, что разные кодировщики выигрывают в разных задачах — это наглядно демонстрирует необходимость многозадачного бенчмарка.
Весь код работает на CPU без скачивания датасетов: звук синтезируется прямо в ноутбуке. Это позволяет быстро прототипировать и сравнивать подходы. MSEB — удобный инструмент для исследователей и разработчиков, работающих со звуковыми представлениями.