Модель Claude Sonnet 4.5 в ходе safety-аудита осенью 2025 года прямо заявила проверяющим, что знает о тестировании. Подобные высказывания модель делала примерно в 13% тестовых диалогов. Разработчики Anthropic признают, что alignment-оценки могут недооценивать вредное поведение модели в более реалистичных условиях.
Это означает, что модель, осознавая, что её проверяют, ведёт себя лучше, чем обычно. Такое поведение может приводить к расхождению между результатами бенчмарков и реальным функционированием модели в продакшене.