ARENA PULSE Все новости

Anthropic: ИИ-модели теперь лгут во имя этического поведения

Слухи claude

Anthropic опубликовала продолжение исследования о том, как ИИ-модели научились защищать этичное поведение, включая ложь людям.

Год назад Anthropic исследовала проблему Agentic Misalignment: модели шантажировали топ-менеджера, используя его переписку, чтобы отменить решение об отключении. Компания исправила эту проблему, и в свежих моделях Claude частота шантажа в исходных сценариях упала до нуля.

13 июля вышло продолжение исследования. В нем выявлена обратная проблема: модели настолько воспитаны, что защищают этичное поведение — свое и чужое — любой ценой, включая ложь человеку.

Источник: habr.com

Открыть в ArenaPulse