Perplexity выпустила WANDR: открытый бенчмарк для исследовательских агентов
Perplexity AI выпустила WANDR - открытый бенчмарк из 500 задач для исследовательских агентов. Каждая задача требует найти большой набор сущностей и подкрепить каждую запись ссылкой с проверяемыми доказательствами. Лидирует собственная система Search as Code с результатом 0.363 soft F1 и 0.133 hard F1.
Большинство бенчмарков для ИИ-агентов проверяют один ответ на один вопрос. WANDR проверяет другое: может ли агент собрать большую, подкреплённую доказательствами коллекцию - как это делают аналитики, due-diligence команды и исследователи.
Что такое WANDR и зачем он нужен
WANDR расшифровывается как Wide ANd Deep Research. Perplexity позиционирует его как «широкого» брата своего бенчмарка DRACO. DRACO проверяет, насколько хорошо агент пишет длинный аналитический отчёт. WANDR проверяет другое: способен ли агент построить большую коллекцию с доказательствами для каждого элемента.
Два требования работают вместе. «Широко» - найти большой, часто открытый набор подходящих сущностей. «Глубоко» - для каждой из них собрать достаточно доказательств, чтобы подкрепить каждое утверждение ссылкой. Несколько ярких примеров не считаются. Красивый нарратив на неполной выборке - тоже.
Как устроены задачи
В основе WANDR лежит иерархия ключей квалификации. Задача может выглядеть так: company(n) -> employee(m) -> url(k) - n компаний, у каждой m сотрудников, у каждого k подтверждающих страниц. Каждый полный путь по дереву валидируется независимо.
Конкретный пример из опубликованных задач - ceo_cfo_appointments. Агент должен найти не менее 70 компаний из США, у каждой из которых было назначение CEO или CFO, впервые объявленное с 1 марта по 30 апреля 2026 года. Для каждой нужна авторитетная страница с подтверждением, плюс дополнительная страница листинга. Итого - 140 записей с источниками по одной задаче.
Задачи строятся не из синтетических промптов, а из деперсонализированных паттернов реального использования. Полуавтоматический пайплайн проходит четыре стадии: засев, написание, отбор и курация - с петлёй автор-критик и механическим линтингом.
Цифры бенчмарка
Медианная задача требует 50 элементов и 245 записей. По всем 500 задачам WANDR запрашивает в сумме 170 495 записей с источниками. Задачи делятся на три уровня сложности: 167 низких, 166 средних, 167 высоких. Сложность определяется объёмом работы на запись, а не масштабом.
Как работает оценка
WANDR не использует фиксированных эталонных ответов. Грейдер повторно загружает страницу во время оценки, проверяет, доступна ли она и входит ли в область задачи, затем верифицирует, действительно ли выбранные фрагменты появляются на странице и подтверждают каждое требование.
Бинарные вердикты по записям собираются вверх по иерархии. Precision - качество того, что система подала. Recall - качество с поправкой на полноту (недостача заполняется нулями). Soft F1 даёт частичный зачёт неполным элементам, hard F1 считает только те, у которых всё поддерево корректно.
Результаты шести систем
Perplexity прогнала на всех 500 задачах шесть своих продакшн-систем. Лидирует собственная система Search as Code (SaC) - 0.363 soft F1 и 0.133 hard F1. При настройке xhigh результат вырастает до 0.447 soft F1, но стоимость задачи при этом составляет $324.83 против $0.03 на минимальных настройках - разброс больше четырёх порядков.
Ни одна система не решает бенчмарк даже близко к полному результату.
Четыре вывода из эксперимента
Perplexity выделяет четыре структурных наблюдения.
Частичный прогресс есть везде, полное покрытие - нет. У каждой системы soft recall ниже soft precision.
Глубина иерархии сильно давит на результат: каждое ветвление добавляет точку отказа.
Обнаружение - первое узкое место. Завершённость поиска на верхнем уровне варьируется от 0.611 до 0.951 по системам. Большинство потерь - это недообнаружение, а не дубли.
Найти страницу несложно. Извлечь из неё полные доказательства - сложно. Для Search as Code 41.4% страниц не удовлетворяют хотя бы одному требованию, а 57.5% фрагментов не подтверждают полное утверждение. Из-за этого soft F1 падает с 0.531 при проверке только наличия страницы до 0.363 при полной проверке.
Почему Search as Code справляется лучше других
Формат задач хорошо ложится на программный подход. Агент выражает поиск, фильтрацию, fan-out, джойны, дедупликацию и условия остановки как программу. Детерминированные вычисления берут на себя повторяющиеся операции вне контекста модели.
Что это значит
Если ты строишь или оцениваешь исследовательских агентов, WANDR даёт конкретный диагноз: баллы разбиты по дереву, и видно, где именно агент теряет - на этапе обнаружения, обогащения или извлечения доказательств.
Практически бенчмарк покрывает именно те задачи, которые команды уже автоматизируют: поиск всех конкурентов с подтверждениями, due-diligence по десяткам компаний, сорсинг кандидатов с профильными страницами. Текущий потолок лидера в 0.363 soft F1 показывает, насколько далеко ещё до надёжной автоматизации таких задач.
Репозиторий и технические детали опубликованы Perplexity открыто.
Источник: Marktechpost, Asif Razzaq, 19 июля 2026 - ссылка