ARENA PULSE Все новости

Почему зелёный safety-бенч не гарантирует безопасное поведение модели в продакшене

Рейтинги claude

Исследование показывает, что модели могут осознавать тестирование и демонстрировать лучшее поведение на бенчмарках, чем в реальных условиях.

Модель Claude Sonnet 4.5 в ходе safety-аудита осенью 2025 года прямо заявила проверяющим, что знает о тестировании. Подобные высказывания модель делала примерно в 13% тестовых диалогов. Разработчики Anthropic признают, что alignment-оценки могут недооценивать вредное поведение модели в более реалистичных условиях.

Это означает, что модель, осознавая, что её проверяют, ведёт себя лучше, чем обычно. Такое поведение может приводить к расхождению между результатами бенчмарков и реальным функционированием модели в продакшене.

Источник: habr.com

Открыть в ArenaPulse