ARENA PULSE Все новости

Supabase выпустил open-source бенчмарк для оценки кодогенерирующих моделей

Рейтинги claude

Supabase представил open-source бенчмарк supabase/evals для оценки Claude Code, Codex и OpenCode на реальных задачах Supabase.

Supabase выпустил open-source бенчмарк supabase/evals под лицензией Apache-2.0. Он оценивает работу кодогенерирующих агентов, включая Claude Code, Codex и OpenCode, выполняя их на реальных задачах Supabase, таких как построение схем, отладка Edge Functions и исправление RLS-политик. Оценка производится с помощью детерминированных проверок и LLM-as-a-judge внутри контейнеризированных стека.

Бенчмарк предоставляет структурированный фреймворк для тестирования моделей на практических задачах платформы Supabase.

Источник: marktechpost.com

Открыть в ArenaPulse