Система работает через команду claude plugin eval, которая сравнивает работу модели с и без плагина по трём вопросам: срабатывание навыка, его устойчивость к правкам или смене модели, превосходство над базовой моделью. Δ-разница между результатами с плагином и без него доказывает его вклад; если Δ близок к нулю при срабатывании градера tool_used: Skill, это означает, что навык не активируется на естественных запросах.
Anthropic представил систему оценки плагинов для Claude Code
Anthropic внедрил систему оценки плагинов в Claude Code с шестью типами градеров и CI-воротами.
Источник: marktechpost.com
Открыть в ArenaPulse