Kyutai научил speech-to-speech модель решать математику вслух: RL поднял точность с 27% до 77%
Kyutai представила Voice of Reason — две speech-to-speech модели с открытыми весами, которые решают математические задачи вслух. В основе лежит GLM-4-Voice-9B, дообученный в два этапа: сначала supervised fine-tuning (SFT) на 150 616 задачах из Orca-Math, затем reinforcement learning (RL). Результат — точность на spoken GSM8K выросла с 27,3% у базовой модели до 77,1%. При этом в цепочке нет отдельного распознавания речи и текстовой LLM — модель работает напрямую с аудио.
Speech-native модели отстают в рассуждениях из-за необходимости выдавать аудио с постоянной частотой, что ограничивает количество скрытых токенов. Предыдущий метод STITCH давал 58,7%, а Kyutai впервые применили RL для математических рассуждений в speech-native моделях. На этапе SFT точность поднялась до 61,7%, а RL добавил ещё 15,4 процентных пункта. Для обучения использовали 16 GPU H100 и 1500 шагов RL.
Два ключевых технических приёма: коррекция температуры (без неё точность падала с 65,5% до 12,3%) и объединение аудиотокенов — все вероятности аудиословаря суммируются в один абстрактный токен, что снижает дисперсию градиента. Авторы доказали несмещённость такой оценки. Модели работают на одном H100 в BF16, для инференса нужен репозиторий GLM-4-Voice (токенизатор и декодер). Веса распространяются под лицензией GLM-4-Voice, провайдеры Hugging Face пока не поддерживают инференс.