Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Чей перевод лучше: западные и китайские LLM прошли бенчмарк художественного текста

23.09.2026 · habr.com ↗

Для тех, кто переводит книги и длинные тексты нейросетями, качество — больной вопрос. Теперь его можно измерить: в опенсорсный конвейер BookTrans встроили бенчмарк художественного перевода. Внутри — рассказ со ста ловушками: идиомы, игра слов, культурные отсылки, где LLM обычно спотыкаются. Оценку ставит не человек, а LLM-судья с ключом ответов, а итоговый балл считает код — без ручной возни.

На бенчмарке прогнали флагманы Anthropic, OpenAI и Google против китайских моделей. Результаты показывают, насколько сильно различается качество перевода у западных и восточных LLM. Главный практический вопрос, который разбирают авторы: стоит ли переплачивать за топовые западные API или китайские модели дают сопоставимый результат за меньшие деньги.

Бенчмарк открыт и встроен в конвейер, так что любой может воспроизвести тест на своих данных. Это удобный инструмент для команд, которые автоматизируют перевод контента и хотят выбирать модель осознанно, а не на глазок.

Источник: habr.com
← Все новости AI Wave