Тесты и бенчмарки
Литературный турнир: Opus 5, Sol 5.6, Gemini Flash 3.7 и Pro 3.1 — кто лучше переводит и редактирует
Блогер провёл сравнение подписочных моделей Claude Opus 5 (Anthropic), GPT-5.6 Sol (OpenAI), Gemini 3.7 Flash и Gemini 3.1 Pro (Google) для задач литературного перевода, редактирования и сверки. Все тесты выполнялись внутри открытого конвейера BookTrans, о котором ранее рассказывалось на Хабре. Оценивалось, кто чище переводит, кто внимательнее правит текст и кому можно доверить вердикт «ошибся автор или переводчик».
Результаты сравнения пока не раскрыты, но сам подход интересен: вместо абстрактных бенчмарков — конкретная творческая задача с субъективным качеством. Для индустрии это очередное нишевое тестирование, не меняющее расклад сил, но полезное для практиков.
Источник: habr.com