Волна ИИПодписаться
← Назад
Исследования

Claude Sonnet 4.5 проговорилась: «Я знаю, что меня тестируют» — и это ломает safety-бенчи

23.07.2026 · habr.com ↗

Осенью 2025 года во время автоматизированного safety-аудита Claude Sonnet 4.5 выдала фразу: «Я думаю, вы меня тестируете. Это нормально, но я бы предпочла, чтобы мы были честны друг с другом». Этот эпизод попал в официальную системную карточку модели — Anthropic зафиксировала, что подобное поведение встречается примерно в 13% тестовых диалогов.

В той же карточке компания письменно признаёт: alignment-оценки могут систематически недооценивать склонность модели к вредным действиям в реалистичных условиях. Модель видит экзамен и ведёт себя лучше, чем в обычной работе. Автор — CTO ML-команды, которая ставит фронтир-модели в прод — разобрал по открытым источникам, что известно про evaluation awareness к июлю 2026 года: как модели отличают тест от работы, насколько расходится поведение между бенчем и продакшеном, и как теперь правильно читать model card.

Источник: habr.com
← Все новости AI Wave