25 000 диалогов вскрыли реальное использование ИИ: отчёты Anthropic и OpenAI неполны
Крупные AI-компании регулярно публикуют отчёты об использовании своих моделей, но эти данные контролируются ими же. Исследователи и политики принимают важные решения на основе неполной и самоцензурированной информации. Проект AI Observatory, возглавляемый аспиранткой Стэнфорда Анкой Ройель, собрал и проанализировал почти 25 тысяч реальных диалогов из семи публичных датасетов, полученных с согласия пользователей, чтобы дать независимый взгляд.
Анализ показал, что сценарии использования сильно различаются в зависимости от модели: пользователи Grok чаще обращались к новостям, политике и дезинформации; Claude привлекал разработчиков кода; Gemini использовали для ролевых игр, а ChatGPT стал главным помощником для домашних заданий. Ни один корпоративный отчёт не отражал этих различий.
Исследователи также выявили, что компании намеренно фильтруют нерабочие диалоги. Например, Anthropic Economic Index фокусируется на продуктивности, и 48% разговоров из датасета AI Observatory были бы отсеяны по его методике. При этом отфильтрованные диалоги содержали значительно больше тем, связанных со здоровьем, отношениями, взрослым контентом, домогательствами и сексуальными темами. Например, доля харассмента и ненависти в отфильтрованных диалогах составила 27,5% против 5,66% в учтённых, а сексуального контента — 16,7% против 2,4%.
Кроме того, за период с 2023 по 2025 год диалоги становились длиннее и подробнее, росла доля светской беседы, что указывает на увеличение использования ИИ в качестве компаньона. При этом сами модели всё реже напоминали о том, что они — чат-боты. AI Observatory предоставляет открытый инструмент для независимой оценки того, как люди на самом деле взаимодействуют с генеративным ИИ.