ARENA PULSE Все новости

Perplexity AI представила открытый бенчмарк WANDR для оценки исследовательских агентов

Рейтинги perplexity

Perplexity AI запустила открытый бенчмарк WANDR с 500 задачами для оценки способности исследовательских агентов находить и подтверждать информацию.

Perplexity AI представила WANDR, открытый бенчмарк и инструмент оценки, состоящий из 500 задач, требующих поиска и подтверждения информации. Бенчмарк проверяет, могут ли исследовательские агенты обнаруживать множество релевантных сущностей и подкреплять каждую из них проверяемыми доказательствами.

На текущий момент Perplexity Search as Code лидирует в бенчмарке с показателями 0.363 по soft F1 и 0.133 по hard F1.

Источник: marktechpost.com

Открыть в ArenaPulse