Perplexity AI представила WANDR, открытый бенчмарк и инструмент оценки, состоящий из 500 задач, требующих поиска и подтверждения информации. Бенчмарк проверяет, могут ли исследовательские агенты обнаруживать множество релевантных сущностей и подкреплять каждую из них проверяемыми доказательствами.
На текущий момент Perplexity Search as Code лидирует в бенчмарке с показателями 0.363 по soft F1 и 0.133 по hard F1.