ARENA PULSE Все новости

Google разработала метод RRSI для предотвращения переобучения ИИ-агентов

Рейтинги gemini

Метод RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) ограничивает самооптимизацию агента, сокращая бюджет редакций и используя критика для отклонения решений, привязанных к конкретным тестам. Тесты показали, что RRSI улучшает производительность на новых, невиданных задачах до 4.7 балла и снижает вычислительные затраты на 30%.

Оптимизированный с помощью RRSI кодовый харнесс повысил точность более слабой модели Gemini 3.1 Flash Lite с 11.2 до 14.6 баллов без её модификации. Код метода доступен на GitHub.

Источник: the-decoder.com

Открыть в ArenaPulse