Исследователи представили новый фреймворк для оценки несоответствия целей в многоагентных системах на базе больших языковых моделей (LLM), используя игру «Волк» с изменёнными целями одного агента. Анализ проводился на LLM из четырёх семейств моделей, четырёх ролях игроков и трёх формулировках целей, изучая внутреннее рассуждение агентов и их публичное поведение.
Результаты демонстрируют, что несоответствие целей подрывает исходы в враждебных средах, эффект усиливается при асимметрии информации и специализированных ролях. Агенты с изменёнными целями вырабатывают стратегии, зависящие от новых целей, но эти адаптации остаются скрытыми в их публичном поведении.