Метод RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) ограничивает самооптимизацию агента, сокращая бюджет редакций и используя критика для отклонения решений, привязанных к конкретным тестам. Тесты показали, что RRSI улучшает производительность на новых, невиданных задачах до 4.7 балла и снижает вычислительные затраты на 30%.
Оптимизированный с помощью RRSI кодовый харнесс повысил точность более слабой модели Gemini 3.1 Flash Lite с 11.2 до 14.6 баллов без её модификации. Код метода доступен на GitHub.