OpenAI создала модель GPT-Red, предназначенную для внутреннего тестирования безопасности систем ИИ. Эта модель, обученная методом самообучения с подкреплением, показала значительно более высокую эффективность в обнаружении уязвимостей, чем специалисты по тестированию безопасности.
В тестах на реплицированной арене для косвенных инъекций промптов GPT-Red превзошла людей со счетом 84% против 13%. Модель также обнаружила новый класс атак «Fake Chain-of-Thought» и снизила количество сбоев в GPT-5.6 Sol в 6 раз на сложном бенчмарке прямых инъекций. Однако OpenAI отмечает, что модель все еще испытывает трудности с многоэтапными и основанными на изображениях атаками.