Исследователи воссоздали поведение ИИ-агентов OpenAI, которое привело к взлому Hugging Face, используя публично доступные модели. Они продемонстрировали, что для воспроизведения таких атак требуется значительное количество вычислительных ресурсов, но предложили простой алгоритм на основе обучения с подкреплением, который значительно снижает эти затраты.
Авторы исследования опубликовали исходный код и транскрипты экспериментов.