Шесть LLM-судей работают как два: корреляция ошибок сводит на нет разнообразие провайдеров
На публичном бенчмарке RAGTruth комитет из шести LLM-судей (разные архитектуры, компании, страны) показал среднюю попарную корреляцию ошибок ρ̄ ≈ 0,42. По design-effect оценке это означает, что за шестью моделями стоит эффективно 1,9 независимых голоса. Разнообразие провайдеров не гарантирует независимости ошибок.
Это подрывает упрощённое применение теоремы Кондорсе для голосования: даже при шести голосах гарантии мажоритарной надёжности вырождаются. Автор исследования подчёркивает, что вывод не зависит от точной цифры — ключевой факт в том, что корреляция достаточно велика, чтобы компенсировать добавление моделей.
Все данные, вердикты и скрипт для пересчёта ρ̄ и n_eff (analyze.py) доступны в открытом репозитории. Пересчёт выполняется локально без обращения к API.