Существующие системы отслеживания происхождения данных работают на уровне файлов или наборов данных, что приводит к избыточному удалению при отзыве данных автором. Система ob обеспечивает отслеживание на уровне записей и токенов, распространяя идентичность автора через конвейеры обработки данных и преобразуя запросы на отзыв в точные наборы для забывания.
Тестирование на 219 555 страницах Википедии показало, что отслеживание на уровне записей устраняет избыточное удаление (снижение с 101x до 1.3x). Интеграция системы добавляет 1.3-4.0% накладных расходов на производительность (HuggingFace) и 2.1-19.0% (Datatrove) при обработке вики-данных. На модели размером 1.7B токенов наборы для забывания, основанные на отслеживании, улучшают процесс забывания на 42% по сравнению со случайными базовыми методами.