Artificial Analysis Search Index: Search API 벤치마크 방법론
개요
Search API Bench는 에이전트 기반 검색 패러다임에서 다양한 검색 제공업체를 평가합니다.
이 벤치마크는 제공업체만 교체하는 비교입니다. 모든 샘플이 동일한 후보 답변 모델과 벤치마크 작업을 사용하며, 검색 제공업체만 달라집니다.
단일 답변 모델로 결과를 평가하여 각 Search API 제공업체가 가져오는 향상 폭을 측정합니다.
이 페이지 전반에서 하나의 결과란 고정된 후보 답변 모델과 짝지은 Search API 제공업체를 뜻합니다. 이를 제공업체 결과라고 부릅니다.
핵심 지표
Artificial Analysis Search Index
공개 리더보드는 하나의 통합 점수인 Artificial Analysis Search Index를 대표 지표로 삼습니다. 각 벤치마크의 주요 품질 지표를 동일 가중치로 평균한 값입니다.
계산 시 유의 사항:
- AA-Omniscience는 Omniscience Index나 환각률이 아니라 정확도를 반영합니다. 검색 제공업체와 후보 모델이라는 구도에서는 정확도가 가장 직접적으로 비교 가능한 신호입니다.
- 모든 입력이 동일한 상수(아래 설명)를 사용하므로, 이 지수는 검색 제공업체의 차이만을 분리해 보여줍니다.
지수 구성 요소
| 평가 | 분야 | 작업 수 | 응답 형식 | 채점 |
|---|---|---|---|---|
| DeepSearchQA | 딥 리서치형 QA(단일 답변 및 집합 답변) | 900‡ | 개방형 답변 / 답변 집합 | 답변 항목에 대한 LLM 채점 F1, pass@1 |
| AA-Omniscience | 사실 QA(정답성 + 캘리브레이션) | 600† | 개방형 답변(답변 유보 허용) | LLM 채점 정확도, pass@1 |
| BrowseComp | 난도 높은 웹 검색 QA | 200^ | 짧은 정답 일치형 답변 | LLM 채점 정답 일치 정확도, pass@1 |
세 벤치마크 모두 채점에 GPT-5.6 Luna(medium)를 사용하며, 각 벤치마크 고유의 채점 기준을 적용합니다.
‡ DeepSearchQA: 900개 행으로 구성된 공개 평가 스플릿 전체입니다.
† AA-Omniscience: 비공개로 유지된 600개 샘플이며, 6개 도메인에 걸쳐 도메인당 100개씩 균등 배분했습니다.
^ BrowseComp: 1,266개 샘플 평가 풀에서 뽑은 난도 높은 200개 샘플 부분집합입니다.
상수
아래 값은 모든 제공업체 결과에서 동일하게 고정되므로, 비교에서 달라지는 변수는 검색 제공업체뿐입니다.
- 후보 답변 모델: GPT-5.6 Luna(medium)
- 추론 강도: Medium
- 온도: 0.6
- 최대 출력 토큰: 127,999 토큰
- 채점 모델: GPT-5.6 Luna(medium), 세 벤치마크 공통
- 턴 예산: 에이전트 25턴(t25)
- 샘플당 도구 호출: 턴 예산 내에서 무제한
- 표시되는 검색 결과: 검색 1회당 최대 10건
- 검색 도구:
web_search및web_fetchweb_search— 후보 모델의 질의를 대상 Search API 제공업체로 보내고, 해당 업체의 네이티브 응답 페이로드를 반환합니다.web_fetch— 검색 결과의 URL 하나를 가져와 페이지 내용을 반환합니다(텍스트만).
- 추출 계층: 텍스트 전용 추출기, 페이지당 15초 제한
- 검색 페이로드 형식: 제공업체 네이티브 형식이며, 모델은 제공업체의 원본 응답 본문을 봅니다
- 오염 필터링: 활성화, 아래 설명 참조
- 에이전트 워크플로: 다음 중 하나:
- 검색 없는
model_only기준선, 또는 - Stirrup 검색 에이전트 루프
- 검색 없는
워크플로
모델 단독 기준선
model_only 샘플은 검색 도구 없이 벤치마크 프롬프트로 후보 모델을 원샷으로 직접 호출합니다. 후보 모델이 내부 지식이나 추론만으로 얼마나 풀 수 있는지를 가늠합니다.
model_only 점수가 높다면 해당 벤치마크 샘플이 최신 검색 정보 없이도 답할 수 있음을 뜻하고, model_only 점수가 낮을수록 검색으로 인한 향상을 관찰하기 쉬워집니다.
검색 에이전트 루프
검색을 사용하는 샘플은 Artificial Analysis의 Stirrup 하네스가 조율하는 고정된 에이전트 루프를 사용합니다.
하네스는 web_search와 web_fetch 두 가지 도구를 제공합니다.
해당 검색 제공업체 API가 web_search 도구를 구동하며, 후보 모델에는 주어진 작업을 해결하도록 총 25턴과 무제한 도구 호출이 주어집니다.
충분한 정보를 모았다고 판단하면 모델은 finish 도구를 호출해 최종 답변을 제출합니다. 25턴을 모두 쓰고도 finish를 호출하지 않으면 답변이 제출되지 않고 해당 작업은 0점 처리됩니다.
벤치마크별 채점기가 비공개 참조 데이터와 대조해 답변을 채점합니다.
오류 처리
복구 가능한 오류는 실패한 도구 호출로 모델에 반환되며, 공개 결과에도 그대로 남습니다. 복구 가능한 오류에는 다음이 포함됩니다:
- 가져온 웹 페이지의 시간 초과 또는 HTTP 오류
web_search가 반환하지 않은 URL을 모델이 가져오는 경우
치명적 오류는 성공할 때까지 재시도하며, 치명적 오류가 있는 결과는 공개하지 않습니다. 치명적 오류에는 다음이 포함됩니다:
- Search API 제공업체 오류(예: 429, 5xx, 시간 초과)
비용
비용은 실험 총비용으로 보고하며, 다음과 같이 나눕니다:
- 후보 답변 모델 비용. 모든 입력, 캐시, 추론, 출력 토큰을 포함합니다.
- Search API 제공업체 비용.
- 참고:
model_only기준선에는 Search API 제공업체 비용이 없습니다.
- 참고:
지연 시간
지연 시간은 여러 방식으로 보고합니다:
- 작업당 모델 시간. 작업당 후보 모델의 입력·사고·출력 토큰에 대한 평균 추정 종단 간 시간입니다.
- 작업당 검색 시간. 작업당
web_search에 소요된 평균 실측 시간입니다. - 작업당 시간. 작업당 모델 시간과 검색 시간의 합입니다.
- 검색 쿼리당 시간. 벤치마크 전체에서 개별
web_search요청의 평균 지연 시간입니다.
호출 하나는 빠른 제공업체라도 모델이 더 자주 검색한다면 총 소요 시간은 더 길어질 수 있습니다.
오염 필터링
오염 필터링은 벤치마크 유출 가능성이 있거나 이미 알려진 유출과 그 출처를 제거합니다.
필터링은 후보 모델이 어떤 출력도 보기 전에 두 검색 도구 내부에서 적용됩니다. web_search 결과는 URL, 제목, 스니펫을 기준으로 검사하고, web_fetch의 페이지 텍스트는 추출 이후에 검사합니다. 표시된 항목은 응답 구조를 바꾸지 않은 채 제공업체의 결과 목록에서 제외됩니다.
예를 들면:
- 알려진 출처 위치. 벤치마크가 원래 게시된 URL과 데이터셋입니다.
- 데이터셋 본문의 동반 신호. 원본 자료에 포함된 알려진 카나리 문자열입니다.
검색 제공업체 API 설정
모든 제공업체가 max_results=10(또는 그에 상응하는 설정)을 고정으로 사용합니다. 아래에 나열한 항목을 제외한 모든 설정은 제공업체 기본값을 유지합니다.
| 제공업체 결과 | 문서 | 벤치마크 요청 설정 |
|---|---|---|
| Brave | Brave Web Search API | q=agent query, result_filter=web |
| Tavily basic | Tavily Search API | search_depth=basic |
| You.com | You.com Search API | safesearch=moderate |
| Firecrawl | Firecrawl Search API | scrape_format=none |
| Exa fast | Exa Search API | type=fast, contents={"highlights": True} |
| Exa auto | Exa Search API | type=auto, contents={"highlights": True} |
| Parallel turbo | Parallel Search API | mode=turbo |
| Parallel basic | Parallel Search API | mode=basic |
| Parallel advanced | Parallel Search API | mode=advanced |
| Keenable pro | Keenable Search API | mode=pro |
| Keenable realtime | Keenable Search API | mode=realtime |
벤치마크 범위
DeepSearchQA
단일 답변과 집합 답변 행을 포함한 딥 리서치형 QA 벤치마크입니다.
- 출처: Google DeepSearchQA. Hugging Face. 논문.
- 샘플 범위: 900개 행으로 구성된 공개
eval스플릿 전체입니다. - 주요 지표: F1.
BrowseComp
난도 높은 웹 검색 QA 벤치마크입니다.
- 출처: OpenAI BrowseComp, Simple Evals와 함께 배포됩니다. 논문.
- 샘플 범위: 200개 샘플의
n200판정 패널이며, 선정 방식은 지수 구성 요소에 설명되어 있습니다. - 주요 지표: 정확도.
AA-Omniscience
정답성과 캘리브레이션에 초점을 맞춘 비공개 사실 QA 벤치마크입니다.
- 출처: AA-Omniscience. 공개 참조 데이터셋: AA-Omniscience-Public. 논문.
- 샘플 범위: 비공개 샘플 600개이며, 6개 도메인에 걸쳐 도메인당 100개 행씩 균등 배분했습니다.
- 주요 지표: 정확도.
Omniscience Index나 환각률 대신 정확도를 사용합니다. AA-Omniscience는 파라미터에 담긴 지식과 맥락이 충분하지 않을 때 답변을 유보하는 능력을 시험하도록 설계되었습니다.
검색 도구가 맥락을 공급하면 모델은 거의 항상 답변하는 경향을 보입니다. 따라서 정확도는 제공업체가 준 검색 맥락에서 모델이 얼마나 정확하게 답하는가라는 질문에 대한 단서를 제공합니다.
결과 해석
Search API Bench는 여러 목표를 함께 보는 비교입니다:
- 검색이
model_only보다 답변을 개선했는가? - 품질을 가장 많이 끌어올린 제공업체는 어디인가?
- 그 개선에 비용은 얼마나 들었는가?
- 지연 시간은 얼마나 늘었는가?
- 그 향상이 여러 벤치마크에서 일관되는가, 아니면 특정 작업군에만 해당하는가?
특정 작업에 가장 적합한 제공업체가 반드시 최고 점수를 받은 곳은 아닙니다. 특정 사용 사례에 맞는 검색 제공업체는 다음 기준으로 평가해야 합니다:
- 기준선 대비 품질 향상.
- 기준선 대비 비용 증가.
- 기준선 대비 지연 시간 증가.