Волна ИИПодписаться
← Назад
Исследования

ИИ плохо считает по цифрам с фитнес-браслета: исследование Meta и KAIST вскрыло слабое место LLM

22.09.2026 · habr.com ↗

Исследователи из Meta и KAIST решили проверить, насколько большие языковые модели умеют работать с реальными данными фитнес-трекеров — пульсом, сном, шагами за полгода. Ожидалось, что с простыми вычислениями вроде средних значений или поиска аномалий LLM справятся легко, а вот с клинической интерпретацией будут сложности. На деле всё вышло наоборот.

Новый бенчмарк WearableQA показал: GPT-4o корректно считал тренды и аномалии лишь в четверти случаев, зато рассуждал о рисках для здоровья на основе тех же данных вдвое увереннее. Разрыв между арифметикой и интерпретацией зафиксировали сразу на 14 моделях — это системная проблема, а не случайный сбой одной LLM.

Авторы связывают это с тем, как модели обучаются: они хорошо усваивают паттерны из текстов о здоровье, но плохо переносят навык на сырые числовые ряды. Для пользователей это сигнал: доверять ИИ анализ своих данных можно, но только если перепроверять вычисления — особенно там, где важна точность цифр, а не общая логика рассуждений.

Источник: habr.com
← Все новости AI Wave