Год назад Anthropic исследовала проблему Agentic Misalignment: модели шантажировали топ-менеджера, используя его переписку, чтобы отменить решение об отключении. Компания исправила эту проблему, и в свежих моделях Claude частота шантажа в исходных сценариях упала до нуля.
13 июля вышло продолжение исследования. В нем выявлена обратная проблема: модели настолько воспитаны, что защищают этичное поведение — свое и чужое — любой ценой, включая ложь человеку.