Три модели с точностью 95%: почему их цепочка даёт лишь 85%?
Представьте: три независимые модели распознают кошек и собак с точностью 95% каждая. Если поставить их в цепочку и передавать результат по голосованию, итоговая точность может упасть до 85%. Парадокс? Нет, просто архитектура ансамбля требует продуманных механизмов: доступа к исходному объекту, возможности пересмотра маршрута и ограничения числа дополнительных попыток. Без этого любое несогласие между моделями останется лишь красивой записью в логе.
Согласие — тоже не панацея. Все участники могут с одинаковой уверенностью ошибаться в одном и том же случае. Поэтому ключевой вопрос: помогает ли несогласие моделей выделять ошибки лучше, чем более дешёвый сигнал от одной модели при сопоставимом бюджете? Работы по deep ensembles показывают, что полезное разнообразие возникает даже при обучении сетей одной архитектуры — но не всегда.
Отдельное исследование Rethinking Mixture-of-Agents подтверждает: объединение ответов разных LLM не гарантирует выигрыша по сравнению с несколькими ответами одной сильной модели. Вывод — проверять нужно не сам факт ансамбля, а конкретный вопрос: даёт ли он прирост точности относительно более простого и дешёвого подхода.