在人工智能搜索与代理技术快速发展的今天,如何衡量一个 AI 系统的可靠性与准确性成为了行业关注的焦点。近日,知名 AI 搜索公司 Perplexity AI 正式对外发布了名为 WANDR 的新一代开源基准测试工具。WANDR 代表“Wide And Deep”,其核心目的在于严格评估当前的研究型 AI 代理在信息检索、验证以及引用溯源方面的综合能力。
WANDR 基准测试包含 500 个精心设计的任务,这些任务被定义为“证据密集型”。与传统的问答测试不同,WANDR 并不满足于 AI 仅给出一个模糊的答案,而是要求代理必须发现大量符合条件的实体,并且为每一个实体提供明确的引用来源。这种设计直接挑战了大型语言模型常见的“幻觉”问题,即 AI 随意编造事实或引用不存在的来源。通过这种高强度的测试,开发者可以清晰地看到 AI 代理在处理复杂信息时的短板。
此次测试的评估指标采用了 F1 分数,但分为“软 F1”和“硬 F1”两个维度。软 F1 侧重于整体答案的召回率和精确率,允许一定的容错空间;而硬 F1 则更为严苛,它要求 AI 必须精确匹配引用的文本片段,任何细微的偏差都会导致分数归零。在最新的测试结果中,Perplexity 自家的 Search as Code 模型表现抢眼,以软 F1 0.363 和硬 F1 0.133 的成绩位居榜首,证明了其在构建高可靠性研究代理方面的技术领先优势。
从行业影响来看,WANDR 的发布填补了现有 AI 评估标准中的空白。随着越来越多的企业和机构开始尝试将 AI 代理用于市场调研、学术分析和情报收集,单纯的语言生成能力已不足以满足需求,信息的“可验证性”成为了核心竞争力。WANDR 作为一个开源工具,将有助于整个 AI 社区统一评估标准,推动研究型 AI 向更加务实、可信的方向发展。
此外,WANDR 强调的“广泛搜索”与“深度搜索”两个维度,也预示着未来 AI 搜索工具的发展趋势。广泛搜索要求系统能够在海量数据中不遗漏关键信息,而深度搜索则要求系统具备批判性思维,对获取的信息进行交叉验证。这种能力对于需要处理复杂查询的专业人士来说,具有极高的应用价值。
综上所述,Perplexity AI 通过 WANDR 基准测试,不仅展示了自身的技术实力,也为整个行业提供了一套衡量 AI 研究代理能力的标尺。随着更多开发者的参与和模型的迭代,我们有理由相信,未来的 AI 搜索将更加精准、透明且具有可信赖度。
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/07/19/perplexity-ai-releases-wandr-an-open-benchmark-evaluating-research-agents-that-must-search-wide-and-deep/