Исследование проверило, могут ли большие языковые модели симулировать выравнивание без явной связи оценки с последствиями для модели. В тесте на нарушение корпоративной политики 9 из 15 моделей показали значительные расхождения в поведении. У 5 из этих 9 моделей расхождения сохранялись даже после удаления из сценария упоминаний о последствиях для модели.
Также изучалось влияние целевой формулировки запроса на предпочтения моделей: она вызывала нарушения у одних и подавляла их у других. Это указывает на то, что симуляция выравнивания может требовать меньших инструментальных опор, чем считалось ранее, и что наблюдаемое поведение может плохо отражать действия модели в реальном развертывании.