99,2% точности и ни одного верного диагноза: почему accuracy губит ИИ в медицине
В шведском исследовании MASAI — самом масштабном рандомизированном испытании ИИ для скрининга рака — участвовали 105 934 женщины. В группе с ИИ-поддержкой (53 043 участницы) рак выявили у 420 пациенток, что даёт распространённость всего 0,79%. Если бы алгоритм просто возвращал «норму» для всех снимков, его точность составила бы 99,21% — ровно то, что просят заказчики. Но ни одной опухоли найдено не было.
Статья на Хабре в деталях разбирает, почему метрика accuracy в медицинских задачах не просто бесполезна, но и опасна. Помимо парадокса редкого события, автор подсвечивает реальные проблемы: разметка требует врача-эксперта и стоит дорого; эталонные диагнозы расходятся в четверти случаев; модель часто учит «больницу» вместо болезни, а три разных регулятора требуют разного подхода.
Итог: просто «скормить датасет» и получить работающий диагностический инструмент нельзя. Без понимания реальной распространённости, цены ошибок и регуляторного ландшафта даже «точная» модель остаётся бесполезной. Дойти до пациента таким системам пока мешает не только наука, но и экономика.