Исследования
0.9 — это не 90%: почему модели обманывают своей уверенностью и как это исправить
Порог 0,8 часто воспринимают как 80% уверенности — и на этом строят автоматизацию. Но predict_proba может врать: модель выдаёт число, которое не соответствует реальной частоте правильных ответов. Это приводит к ложной уверенности в продакшене, особенно когда решения принимаются на основе вероятностей.
В статье разбирают, как измерить калибровку модели (например, с помощью калибровочных кривых и Brier score) и какие методы помогают её улучшить: Platt scaling, isotonic regression и temperature scaling. Цель — превратить «сырые» вероятности в честные метрики, на которые можно полагаться при автоматизации.
Источник: habr.com