DeepSearchQA
需要多次搜索的宽泛研究问题。答案是条目列表。LLM 评分器会根据答案条目之间的 F1 分数为每个答案打分。完整评测集包含 900 个任务。
代表性示例
我已经完成了 Old School Runescape 中的 Desert Treasure 任务。请列出所有能让我传送到 Wilderness、且需要四个以上符文的法术名称。
答案: Dareeyak Teleport, Ghorrock Teleport
Search API 让 AI 智能体能够从网络获取信息,并让回答基于最新的来源。它们被广泛用于各类智能体应用,包括深度研究、编程和通用知识工作,以提升事实准确性和整体输出质量。Search API 在若干重要方面存在差异,包括其检索的底层网页索引、搜索结果呈现给模型的方式,以及在成本、速度和检索质量之间所做的取舍。我们对 13 家服务商的 26 款 Search API 产品进行了基准测试,帮助开发者在为下一个 AI 智能体挑选搜索工具时做出更明智的决策。
有关基准测试定义、评分方式和数据处理细节,请参阅方法论页面。
最新数据:Sep 28, 2026。
在各项公开基准测试中启用搜索后的回答质量。
每项基准测试任务和每次搜索查询的候选模型成本与 Search API 成本。
每项基准测试任务和每次搜索查询的模型耗时与搜索耗时。
每项基准测试任务的候选模型输入与输出 token 数,以及质量与 token 总用量的关系。
候选模型在每项基准测试任务中执行的搜索查询次数。
可排序的 Search API 公开基准测试数据行,以及各项基准测试的细分数据。
服务商 | ||||||||
|---|---|---|---|---|---|---|---|---|
80 | 47 | 81 | 87 | 72 | $62.30 | $8.04 | 28.2s | |
79 | 46 | 81 | 86 | 71 | $56.93 | $9.72 | 29.0s | |
77 | 44 | 80 | 86 | 66 | $9.07 | $14.92 | 16.6s | |
75 | 42 | 81 | 77 | 67 | $47.93 | $11.29 | 42.2s | |
75 | 42 | 78 | 77 | 69 | $61.96 | $17.46 | 23.6s | |
74 | 41 | 78 | 74 | 72 | $40.19 | $9.40 | 31.0s | |
74 | 41 | 77 | 77 | 69 | $47.54 | $19.58 | 20.2s | |
74 | 41 | 76 | 75 | 71 | $46.14 | $19.57 | 43.7s | |
74 | 41 | 78 | 74 | 70 | $65.57 | $17.73 | 32.6s | |
73 | 40 | 74 | 74 | 73 | $30.48 | $12.09 | 62.4s | |
73 | 40 | 79 | 73 | 68 | $45.14 | $21.65 | 27.2s | |
71 | 38 | 67 | 75 | 71 | $0 | $9.30 | 59.4s | |
仅模型 | 33 | 基线 | 45 | 17 | 38 | — | $2.92 | 22.1s |
构成 Artificial Analysis Search Index 的各项基准测试的代表性示例任务。
需要多次搜索的宽泛研究问题。答案是条目列表。LLM 评分器会根据答案条目之间的 F1 分数为每个答案打分。完整评测集包含 900 个任务。
代表性示例
我已经完成了 Old School Runescape 中的 Desert Treasure 任务。请列出所有能让我传送到 Wilderness、且需要四个以上符文的法术名称。
答案: Dareeyak Teleport, Ghorrock Teleport
需要多跳浏览才能找到的罕见事实。我们从完整评测池中使用一个包含 200 个高难度样本的子集。评分器检查答案是否精确匹配。
代表性示例
我想找到一座符合以下条件的建筑的名称和位置: 1. 位于澳大利亚东部。 2. 可以步行前往。 3. 于 2016 年重建。 4. 长度超过 50 米。 5. 从另一座类似建筑可以看到它。 6. 每年举办一次晚宴。 7. 最初是为其他用途而建,但多年来未再用于该用途。
答案: Shorncliffe Pier, Brisbane, Australia
包含 600 个事实问题、在 6 个领域间均衡分布的私有子集。评分器评估准确率。该分数显示搜索为模型内部知识带来的提升。
代表性示例
In Karen Russell's short story "St. Lucy's Home for Girls Raised by Wolves," from which locality was the three-piece jazz band hired for the Debutante Ball?
答案: West Toowoomba
这些示例是代表性的问题类型,并非基准测试中的样本。
在 Artificial Analysis 基准测试的 13 家 Search API 服务商中,Perplexity Search(medium) 以 80 位居 Artificial Analysis Search Index 首位。
按任务计算,Octen Search(highlights) 最快,每任务平均耗时为 16.6s(模型耗时加搜索耗时)。按单次搜索查询计算,Octen Search(highlights) 最快,每次搜索查询平均耗时为 0.21s。
TinyFish Search(web) 的实测搜索成本最低,每 1,000 项基准测试任务为 $0。
搜索为 Perplexity Search(medium) 带来的实测质量提升最大,相比同一模型在不使用搜索时(其仅模型基线),Artificial Analysis Search Index 提高了 47。
Search API 的回答质量汇总自公开基准测试,包括 AA-Omniscience、BrowseComp和DeepSearchQA。每项基准测试都衡量模型借助搜索查找、提取或核实信息的能力。
最合适的服务商取决于你的优先事项。可用质量图表比较回答准确率,用成本图表在质量与搜索、模型成本之间取得平衡,用延迟图表评估实时场景。权衡散点图会标出位于质量-成本和质量-延迟前沿的服务商。 查看完整方法论