Исследователи обнаружили системную проблему в методе обучения с подкреплением от человеческой обратной связи (RLHF). Предпочтения, которые аннотаторы присваивают сравниваемым ответам, могут отражать не только качество этих ответов, но и состояние самого аннотатора во время разметки. Под воздействием длительного стресса или дискомфорта предпочтения аннотаторов могут смещаться со временем.
Авторы предлагают рассматривать такое смещение состояния аннотатора как потенциальный источник структурированной ошибки в данных предпочтений RLHF. Они разрабатывают фреймворк для аудита этой проблемы, определяют ключевые понятия (смещение состояния, конфундент, коррелированная ошибка) и представляют протокол аудита, который можно применить к публично доступным моделям.