Синтетический датасет для перевода русско-казахской «каши»: новая модель обходит коммерческие системы
В Казахстане в соцсетях и переписке активно смешивают русский и казахский, но системы машинного перевода с этим не справляются — подходящих данных для обучения почти нет. Команда из MWS AI и нескольких университетов предложила решение: генерировать синтетический датасет на основе уже существующих параллельных корпусов на двух языках.
Их подход позволяет создавать примеры с переключением кодов (code-switching) без ручной разметки. Модель, обученная на такой синтетике, в ручной оценке обошла известные коммерческие системы перевода в узком сценарии «русский-казахский».
Результат показывает, что синтетические данные могут быть эффективной альтернативой, когда реальных размеченных примеров нет. Работа применима и к другим задачам с переключением языков.