ARENA PULSE Все новости

Системная ошибка предпочтений в RLHF: аудит состояния аннотаторов

Рейтинги

Исследователи выявили системную ошибку в данных RLHF, когда предпочтения аннотаторов зависят от их состояния (стресс, усталость), а не только от качества ответов.

Исследователи обнаружили системную проблему в методе обучения с подкреплением от человеческой обратной связи (RLHF). Предпочтения, которые аннотаторы присваивают сравниваемым ответам, могут отражать не только качество этих ответов, но и состояние самого аннотатора во время разметки. Под воздействием длительного стресса или дискомфорта предпочтения аннотаторов могут смещаться со временем.

Авторы предлагают рассматривать такое смещение состояния аннотатора как потенциальный источник структурированной ошибки в данных предпочтений RLHF. Они разрабатывают фреймворк для аудита этой проблемы, определяют ключевые понятия (смещение состояния, конфундент, коррелированная ошибка) и представляют протокол аудита, который можно применить к публично доступным моделям.

Источник: arxiv.org

Открыть в ArenaPulse