Волна ИИПодписаться
← Назад
Исследования

Синтетический датасет для перевода русско-казахской «каши»: новая модель обходит коммерческие системы

24.07.2026 · habr.com ↗

В Казахстане в соцсетях и переписке активно смешивают русский и казахский, но системы машинного перевода с этим не справляются — подходящих данных для обучения почти нет. Команда из MWS AI и нескольких университетов предложила решение: генерировать синтетический датасет на основе уже существующих параллельных корпусов на двух языках.

Их подход позволяет создавать примеры с переключением кодов (code-switching) без ручной разметки. Модель, обученная на такой синтетике, в ручной оценке обошла известные коммерческие системы перевода в узком сценарии «русский-казахский».

Результат показывает, что синтетические данные могут быть эффективной альтернативой, когда реальных размеченных примеров нет. Работа применима и к другим задачам с переключением языков.

Источник: habr.com
← Все новости AI Wave