Модели и агенты
GigaChat Audio на деле: как модель Сбера справляется с голосовыми задачами в работе
Сбер выпустил аудио-нативную LLM GigaChat Audio, которая понимает контекст длинных записей, распознаёт эмоции и умеет работать с голосом напрямую. Разработчик Данила (@pushnoydan) задеплоил модель локально и целый день гонял её на рабочих задачах: поручал разбирать голосовые от коллег, составлять саммари по аудиозаписям и вычленять ключевые моменты из встреч.
По его словам, модель справилась с основными сценариями, хотя без ошибок не обошлось. Полный разбор с примерами и выводами — в статье на Хабре.
Источник: habr.com