ИИ плохо считает по цифрам с фитнес-браслета: исследование Meta и KAIST вскрыло слабое место LLM
Исследователи из Meta и KAIST решили проверить, насколько большие языковые модели умеют работать с реальными данными фитнес-трекеров — пульсом, сном, шагами за полгода. Ожидалось, что с простыми вычислениями вроде средних значений или поиска аномалий LLM справятся легко, а вот с клинической интерпретацией будут сложности. На деле всё вышло наоборот.
Новый бенчмарк WearableQA показал: GPT-4o корректно считал тренды и аномалии лишь в четверти случаев, зато рассуждал о рисках для здоровья на основе тех же данных вдвое увереннее. Разрыв между арифметикой и интерпретацией зафиксировали сразу на 14 моделях — это системная проблема, а не случайный сбой одной LLM.
Авторы связывают это с тем, как модели обучаются: они хорошо усваивают паттерны из текстов о здоровье, но плохо переносят навык на сырые числовые ряды. Для пользователей это сигнал: доверять ИИ анализ своих данных можно, но только если перепроверять вычисления — особенно там, где важна точность цифр, а не общая логика рассуждений.