Artificial Analysis Search Index: benchmark e ranking de Search APIs

As Search APIs permitem que agentes de IA recuperem informações da web e fundamentem suas respostas em fontes atualizadas. Elas são usadas em uma ampla gama de aplicações agênticas, incluindo pesquisa profunda, programação e trabalho de conhecimento geral, para melhorar a factualidade e a qualidade dos resultados. As Search APIs diferem em vários aspectos importantes: o índice da web que consultam, a forma como os resultados são apresentados ao modelo e os compromissos que assumem entre custo, velocidade e qualidade de recuperação. Avaliamos 11 produtos de Search API de 7 provedores para ajudar desenvolvedores a tomar decisões mais informadas ao escolher uma ferramenta de busca para o próximo agente de IA.

Para definições dos benchmarks, pontuação e detalhes de tratamento de dados, consulte a página de metodologia.

Dados mais recentes: Aug 17, 2026.

Stirrup Stirrup agent
Benchmark tasks
Candidate model
GPT-5.6 Luna (medium)
turn 0 / 25
 
Search provider
 
web_search  
native payload, up to 10 results
Grading
Grader
avg F1 0.79
 
Search API providers
Constants
Same tasks, same model and grader (GPT-5.6 Luna, medium), same Stirrup harness (web_search · web_fetch · finish, max 25 turns). Only the search provider varies.

Destaques

Melhor resultado de Search API entre 3 benchmarks
Custo médio de modelo e de Search API por tarefa (USD) · Lower is better
Tempo médio de modelo e de busca por tarefa · Lower is better

Resultados

Qualidade das respostas com busca em benchmarks públicos.

Artificial Analysis Search Index

Média com pesos iguais do F1 do DeepSearchQA, da precisão no BrowseComp e da precisão no AA-Omniscience · Higher is better
Somente modelo (33)

The equal-weighted mean of each Search API provider's score on DeepSearchQA (average F1), BrowseComp (exact-answer accuracy), and AA-Omniscience (accuracy), shown on a 0-100 scale. Every result runs the same candidate answer model, harness, and settings. The only variable is the Search API provider.

The dashed line represents the candidate answer model, GPT-5.6 Luna (medium), run with no search tools and is considered the baseline. See the Search API methodology for the full harness settings.

Custo

Custo do modelo candidato e da Search API por tarefa do benchmark e por consulta de busca.

Custo por tarefa

Custo médio do modelo candidato e da Search API por tarefa (USD) · Lower is better
Somente modelo ($0.0029)

Total cost of one benchmark task, split into the candidate answer model's tokens (input, cached, reasoning, and output) and the Search API provider's list price for the searches the model chose to run. The model-only baseline runs no searches, so its cost is token cost alone. Model cost can differ per provider due to differences in returned payloads for a given query, increased numbers of searches performed (due to not getting the right results) as well as increased reasoning token usage when search results are of lower quality.

The dashed line represents the candidate answer model, GPT-5.6 Luna (medium), run with no search tools and is considered the baseline. See the Search API methodology for the full harness settings.

Artificial Analysis Search Index x custo por tarefa

Artificial Analysis Search Index x custo total de modelo e busca por tarefa do benchmark (USD)
Most attractive quadrant
Pareto line

Total cost of one benchmark task, split into the candidate answer model's tokens (input, cached, reasoning, and output) and the Search API provider's list price for the searches the model chose to run. The model-only baseline runs no searches, so its cost is token cost alone. Model cost can differ per provider due to differences in returned payloads for a given query, increased numbers of searches performed (due to not getting the right results) as well as increased reasoning token usage when search results are of lower quality.

Latência

Tempo de modelo e tempo de busca por tarefa do benchmark e por consulta de busca.

Tempo por tarefa

Tempo médio de modelo derivado e tempo de busca medido por tarefa · Lower is better
Somente modelo (15.9s)

The sum of model time and search time for one benchmark task. Model time is derived: answer and reasoning tokens per task divided by the model's canonical answer output speed. Search time is the measured time spent in web_search calls. A provider can be fast per call and still add more total time if the model searches against it more often.

The dashed line represents the candidate answer model, GPT-5.6 Luna (medium), run with no search tools and is considered the baseline. See the Search API methodology for the full harness settings.

Artificial Analysis Search Index x tempo por tarefa

Artificial Analysis Search Index x tempo médio de modelo e busca por tarefa do benchmark (segundos)
Most attractive quadrant
Pareto line

The sum of model time and search time for one benchmark task. Model time is derived: answer and reasoning tokens per task divided by the model's canonical answer output speed. Search time is the measured time spent in web_search calls. A provider can be fast per call and still add more total time if the model searches against it more often.

Detalhes do ranking

Linhas ordenáveis do benchmark público de Search APIs e detalhamento por benchmark.

Ranking público de Search APIs

Qualidade, latência e custo de Search API por provedor, com detalhamento por benchmark.
12 linhas
Provedor
Parallel Search (advanced) logoParallel Search (advanced)
75
42
81
77
67
$47.93
$35.58
37.5s
Exa Search (auto) logoExa Search (auto)
74
41
78
74
70
$65.57
$61.58
27.8s
Firecrawl Search logoFirecrawl Search
73
40
74
74
73
$30.48
$44.94
56.9s
Parallel Search (basic) logoParallel Search (basic)
73
40
79
73
68
$45.14
$69.69
22.2s
Exa Search (fast) logoExa Search (fast)
68
35
76
61
69
$78.11
$80.53
22.6s
You.com Search logoYou.com Search
68
35
63
74
66
$68.93
$58.28
35.8s
Parallel Search (turbo) logoParallel Search (turbo)
67
34
70
75
56
$13.64
$46.57
20.7s
Keenable Search (pro) logoKeenable Search (pro)
67
34
70
66
65
$23.69
$73.20
24.8s
Keenable Search (realtime) logoKeenable Search (realtime)
67
34
70
64
66
$26.87
$63.67
16.8s
Tavily Search (basic) logoTavily Search (basic)
66
33
74
59
64
$126
$66.58
38.6s
Brave Search logoBrave Search
65
32
62
67
65
$71.61
$74.52
28.9s
Somente modelo
33
linha de base
45
17
38
$2.92
15.9s

Search $/1k and Model $/1k are the average cost of 1,000 benchmark tasks broken down into search and model token costs. The model-only baseline runs no searches.

The sum of model time and search time for one benchmark task. Model time is derived: answer and reasoning tokens per task divided by the model's canonical answer output speed. Search time is the measured time spent in web_search calls. A provider can be fast per call and still add more total time if the model searches against it more often.

Tarefas de exemplo

Tarefas de exemplo representativas de cada benchmark que compõe o Artificial Analysis Search Index.

DeepSearchQA

Broad research questions that need many searches. Answers are lists of items. An LLM grader scores each answer with an F1 score over the answer items. The full eval split has 900 tasks.

Representative example

I've completed the Desert Treasure quest on Old School Runescape, can you list all the names of the spells I can use to teleport into the wilderness that require more than four runes?

Answer: Dareeyak Teleport, Ghorrock Teleport

BrowseComp

Hard-to-find facts that need multi-hop browsing. We use a hard 200-sample subset from the full evaluation pool. The grader checks for an exact answer.

Representative example

I'm looking for the name and location of a structure which fulfills the following criteria: 1. Located in Eastern Australia. 2. Can be visited on foot. 3. Was re-built in 2016. 4. Is longer than 50m. 5. Can be seen from another similar structure. 6. Hosts a yearly dinner. 7. Was originally built for another use case, but has not served that use case for a number of years.

Answer: Shorncliffe Pier, Brisbane, Australia

AA-Omniscience

A private subset of 600 factual questions, balanced across 6 domains. The grader scores accuracy. The score shows how much search adds to the model's internal knowledge.

Representative example

In Karen Russell's short story "St. Lucy's Home for Girls Raised by Wolves," from which locality was the three-piece jazz band hired for the Debutante Ball?

Answer: West Toowoomba

The examples are representative problem types, not samples from the benchmarks.

Metodologia e mais informações

As métricas de Search API são agregadas a partir de execuções públicas de benchmarks e incluem linhas de base somente modelo quando disponíveis. Consulte a página de metodologia para detalhes de pontuação, latência, custo e cobertura dos benchmarks.

Perguntas frequentes

Parallel Search (advanced) lidera o Artificial Analysis Search Index com 75 entre os 7 provedores de Search API avaliados pela Artificial Analysis.

Por tarefa, Keenable Search (realtime) é a mais rápida, com tempo médio por tarefa de 16.8s (tempo de modelo mais tempo de busca). Por consulta de busca individual, Keenable Search (realtime) é a mais rápida, com tempo médio por consulta de busca de 0.34s.

Parallel Search (turbo) tem o menor custo de busca medido, com $13.64 por 1.000 tarefas do benchmark.

A busca traz o maior ganho de qualidade medido para Parallel Search (advanced), elevando o Artificial Analysis Search Index em 42 em relação ao mesmo modelo sem busca (sua linha de base somente modelo).

A qualidade das respostas das Search APIs é agregada a partir de benchmarks públicos, incluindo AA-Omniscience, BrowseComp e DeepSearchQA. Cada um mede a capacidade de um modelo de encontrar, extrair ou verificar informações usando busca.

O melhor provedor depende das suas prioridades. Use os gráficos de qualidade para comparar a precisão das respostas, os gráficos de custo para equilibrar qualidade e custo de busca e de modelo, e os gráficos de latência para casos de uso em tempo real. Os gráficos de dispersão de compromissos destacam os provedores nas fronteiras de qualidade-custo e qualidade-latência. Ver a metodologia completa