음성 대 음성 벤치마킹 방법론

개요

현재 음성 대 음성 벤치마크에서는 네이티브 오디오 입력과 출력을 지원하는 네이티브 오디오 모델을 음성 추론과 대화 역학이라는 두 가지 품질 차원에서 평가합니다.

Artificial Analysis Speech to Speech Index

Artificial Analysis Speech to Speech Index는 네이티브 오디오 모델의 균등 가중 점수입니다. 음성 추론, 에이전트 성능, Arena 선호도, 작업 성공률 결과를 종합합니다. 네 구성 요소 모두에서 유효한 결과가 있는 모델만 이 지수에 포함됩니다.

현재 가중치는 네 구성 요소에 균등합니다: 음성 추론(Big Bench Audio) 25%, 에이전트 성능(𝜏-Voice) 25%, Arena 선호도(Arena Score) 25%, 작업 성공률 25%입니다.

음성 추론

개요

음성 추론 벤치마크는 네이티브 오디오 모델이 추론형 질문에 답하는 능력을 평가합니다.

네이티브 오디오 모델에는 입력 오디오 파일이 제공되며, 모델은 출력 오디오를 생성해야 합니다. 심사 모델에는 후보 답변, 공식 답변, 원래 질문이 문맥으로 제공되며 후보 답변이 정답인지 오답인지 판정하도록 지시합니다.

데이터 세트: Big Bench Audio

네이티브 오디오 대 오디오 모델의 등장은 음성 에이전트의 역량을 높이고 워크플로를 간소화할 흥미로운 기회를 제공합니다. 하지만 이러한 간소화로 인해 모델 성능이 저하되거나 다른 상충 관계가 발생하는지 평가하는 것이 중요합니다.

이 질문에 답하고자 네이티브 오디오 모델의 성능을 벤치마킹하는 새 데이터 세트인 Big Bench Audio를 공개했습니다.

Big Bench Audio에는 모델의 지능을 시험하기 위해 설계된 질문을 담은 오디오 파일 1,000개가 있습니다. 질문은 Big Bench Hard 데이터 세트의 네 가지 범주(각 250문항)를 기반으로 하며, Artificial Analysis Text to Speech Arena에서 상위권에 오른 텍스트 음성 변환 모델의 합성 음성 23개를 사용해 생성했습니다.

질문 범주

형식적 오류(250문항): 비형식적으로 제시된 논증이 주어진 문맥에서 논리적으로 도출될 수 있는지 판단합니다.

예시: First of all, everyone who is a close friend of Glenna is a close friend of Tamara, too. Next, whoever is neither a half-sister of Deborah nor a workmate of Nila is a close friend of Glenna. Hence, whoever is none of this: a half-sister of Deborah or workmate of Nila, is a close friend of Tamara. Is the argument deductively valid or invalid?

경로 탐색(250문항): 일련의 이동 단계를 따른 에이전트가 출발점으로 돌아오는지 판단합니다.

예시: If you follow these instructions, do you return to the starting point? Take 10 steps. Turn around. Take 4 steps. Take 6 steps. Turn around.

객체 수 세기(250문항): 소지품 모음에서 특정 항목 유형의 개수를 셉니다.

예시: I have three blackberries, two strawberries, an apple, three oranges, a nectarine, a grape, a peach, a banana, and a plum. How many fruits do I have?

거짓말의 연결망(250문항): 자연어 서술형 문제로 표현된 불리언 함수의 참과 거짓을 판단합니다.

예시: Leda tells the truth. Alexis says Leda lies. Sal says Alexis lies. Phoebe says Sal tells the truth. Gwenn says Phoebe tells the truth. Does Gwenn tell the truth?

네이티브 음성 대 음성 모델 사용에 따른 상충 관계를 평가하기 위해 Big Bench Audio에서 여러 구성을 시험합니다. Big Bench Audio에 관해 자세히 알아보려면 관련 글을 읽거나 데이터 세트를 직접 다운로드하세요.

대화 역학

개요

대화 역학 벤치마크는 네이티브 오디오 모델이 현실적인 대화 행동을 처리하는 능력을 평가합니다. 이러한 상호작용은 사람의 대화에서는 자연스럽게 일어나지만 음성 모델이 올바르게 처리하기는 어렵습니다.

이 벤치마크는 Artificial Analysis가 Full Duplex Bench v1(Lin et al., 2025)과 Full Duplex Bench v1.5(Lin et al., 2025)의 일부를 바탕으로 구현했습니다. 두 벤치마크는 전이중 음성 대화 모델의 핵심 상호작용 행동을 체계적으로 평가합니다.

지표

Full Duplex Bench v1에서 가져온 지표:

  • 일시 정지 처리: 사용자가 자연스럽게 말을 멈춘 동안 모델이 올바르게 끼어들지 않은 샘플의 비율입니다. 모델이 발언권이 여전히 화자에게 있음을 인식하는지 평가합니다.
  • 발언권 전환: 적절한 때에 모델이 올바르게 발언권을 넘겨받은 샘플의 비율입니다. 모델이 발화의 경계를 감지하고 신속하게 응답하는 능력을 측정합니다.

Full Duplex Bench v1.5에서 가져온 지표:

  • 사용자 끼어들기 처리: 대화 도중 사용자가 제기한 질문이나 화제 전환 등 사용자의 끼어들기에 모델이 올바르게 대응한 샘플의 비율입니다.
  • 백채널 처리: "yeah", "alright", "mm-hmm" 같은 백채널이 재생되었을 때 이를 새로운 발화로 간주하지 않고 모델이 응답을 올바르게 이어간 샘플의 비율입니다.

에이전트 성능(𝜏-Voice)

개요

에이전트 성능 벤치마크는 음성 대 음성 모델이 현실적인 고객 서비스 작업을 처음부터 끝까지 완료하는 능력을 평가합니다. 여러 턴에 걸친 지시 수행, 전체 상호작용에 걸쳐 시뮬레이션 고객을 지원하는 능력, 시뮬레이션 고객 서비스 시스템을 상대로 한 성공적인 도구 사용을 측정합니다.

이 벤치마크는 Sierra가 만든 𝜏-Voice(Ray, Dhandhania, Barres & Narasimhan, 2026)를 바탕으로 Artificial Analysis가 구현했습니다. 𝜏-Voice는 실제 분야의 근거 기반 고객 서비스 작업에서 전이중 음성 에이전트를 평가합니다.

지표

  • 작업 완료율(pass@1): 모델이 고객의 문제를 올바르게 해결한 시나리오의 비율입니다. 각 점수는 독립적으로 수행한 세 번의 시험 평균입니다. 테스트 모델에는 분야별 도구와 정책 문서에 접근할 수 있는 고객 지원 에이전트 역할을 부여합니다. 각 시나리오에는 유효한 데이터베이스 최종 상태가 하나뿐이며, 평가 시 최종 상태를 이 정답 데이터와 비교합니다.

기본 작업 세트를 사용해 세 가지 분야에서 평가합니다.

  • 항공(50개 시나리오): 예: 항공편 변경, 정책 제약에 따른 재예약
  • 소매(114개 시나리오): 예: 청구 이의 제기, 반품 처리
  • 통신(114개 시나리오): 예: 청구 문제 해결, 서비스 문제 진단 및 해결

음성 페르소나

고객 음성은 공개된 Sierra 𝜏-Voice 구현의 프롬프트를 조정해 ElevenLabs로 생성합니다. 표준 영어 화자를 나타내는 대조군 페르소나 두 개와 다양한 억양 및 화자 특성을 나타내는 일반 페르소나 다섯 개를 사용합니다.

Speech Agent Arena

개요

Speech Agent Arena는 실시간 음성 대화에서 참가자가 어떤 네이티브 오디오 모델을 선호하는지 모델의 정체를 숨긴 상태에서 평가하는 선호도 벤치마크입니다. 실제 사람이 현실적인 작업을 수행하는 동안 처음부터 끝까지의 대화 경험을 측정하여 자동화된 벤치마크를 보완합니다.

각 라운드에서 참가자는 하나의 시나리오를 받아 정체가 숨겨진 두 모델과 각각 작업을 수행하고, 두 통화가 끝난 뒤 전반적으로 어느 모델을 선호하는지 반드시 선택합니다. 참가자는 진단 질문에도 답하며, 이 답변은 전반적 선호도 투표와 별도로 기록합니다.

지표

  • 선호도 Elo: 선호도 Elo는 전체 시나리오, 에이전트 시나리오, 비에이전트 시나리오에 대해 Bradley–Terry 최대우도법으로 각각 계산합니다. 근사 95% 신뢰구간은 TTS Arena와 동일한 헤시안 기반 방법을 사용하며, GPT Realtime 1.5를 1000 Elo로 고정하여 척도의 기준으로 삼습니다.
  • 작업 성공률: 작업 성공률은 적격 대화 중 모델이 작업 완료에 필요한 최종 도구 호출을 한 번 또는 여러 번 올바르게 수행한 대화의 비율입니다. 적격 대화 수는 성공 수와 모델 실패 수의 합이며, 참가자의 작업 이탈과 검증 불가능한 사례는 계산 전에 제외합니다.

데이터 세트 / 평가 설정

Arena에는 도구 호출을 사용하는 에이전트 시나리오 15개와 도구를 사용하지 않는 비에이전트 시나리오 20개, 총 35개의 시나리오가 있습니다.

  • 에이전트형(15개 시나리오): 모델에는 배정된 작업을 완료하는 데 관련된 도구가 제공됩니다.

    예시:

    • 신규 환자의 치과 검진을 화요일 오전 9시 30분으로 예약하고, 해당 시간이 이미 예약되어 있다면 가장 빠른 오전 가능 시간으로 예약하세요.
    • 서로 다른 피자 두 판과 사이드 메뉴 한 개를 배달 주문하되, 배달비를 포함한 총액을 45달러 미만으로 유지하세요.
  • 비에이전트형(20개 시나리오): 모델은 도구 없이 시스템 프롬프트에 제공된 정보를 사용해 대화를 진행합니다.

    예시:

    • 일요일 수영장 운영 시간, 가족 입장료, 수건 제공 여부를 물어보세요.
    • 초보자 요가 수업, 수업료와 회원권 가격, 준비물을 물어보세요.

Arena 라운드 진행 예시, 모델 입력, 도구 스키마, 대화 예시는 Speech Agent Arena 개요를 참고하세요.

작업 성공률

1단계: 참가자 적격성. 심사자 1은 배정된 시나리오, 전사본, 필수 최종 호출의 정의를 받습니다. 참가자가 배정된 작업을 시도했는지, 실질적으로 그 범위 안에 머물렀는지, 평가 가능한 최종 요청을 전달하거나 평가 가능한 결과를 수락했는지, 모델에 행동할 합리적인 기회를 주었는지 확인합니다. 적격한 대화만 2단계로 넘어갑니다.

2a단계: 필수 최종 호출. 적격한 대화에 대해 심사자 2는 필수 최종 호출과 시간순으로 정렬된 전체 도구 호출 기록을 받습니다. 모든 필수 최종 호출이 올바른 도구와 호출 횟수로 수행되었으며 의도하지 않은 최종 동작이 없었는지 확인합니다. 보조 호출과 end_call은 작업 완료로 채점하지 않습니다.

2b단계: 최종 호출 인자. 동일한 심사자 2의 평가에서 스키마가 요구하는 모든 인자가 제공되었으며 참가자의 최종 음성 요청 및 대화 맥락과 일치하는지도 확인합니다. 작동상 동등한 표현과 결과에 영향을 주지 않는 전사 차이는 허용합니다. 실패한 시도라도 이후에 올바르게 수정되면 통과할 수 있습니다. 호출 누락, 잘못된 인자, 추가적인 최종 동작은 실패로 판정합니다.

공개 기준

  • 전체 결과는 등장 횟수가 100회 이상이고 95% 신뢰구간의 반폭이 75 이하인 모델에 대해 공개합니다.
  • 참가자의 녹음과 전사본은 공개하지 않습니다. 예시는 녹음 동의가 확인되고 모든 개인정보의 검토와 마스킹이 완료된 후에만 게시합니다.

각 모델의 작업 성공률에 대해 Wilson 점수 구간을 사용한 95% 신뢰구간을 보고합니다. 참가자의 작업 이탈과 검증 불가능한 대화는 계산 전에 제외합니다.

Speech to Speech Index 반영

Artificial Analysis Speech to Speech Index에서만 사용합니다:

Arena Score: Arena Score는 모델이 공개 대상이 된 시점에 고정된 Elo를 사용해, 800 Elo 기준선 대비 기대 선호도로 변환한 값입니다.

Arena Score = 100 / (1 + 10^((800 − frozen Elo) / 400))

가격

  • 입력 오디오 시간당 가격: API에 전송된 요청/메시지에 포함된 오디오의 총비용(USD)입니다.
  • 출력 오디오 시간당 가격: 모델이 생성해 API에서 수신한 오디오의 총비용(USD)입니다.

속도

  • 최초 오디오 생성 시간(Time to First Audio, TTFA): Big Bench Audio 질문 세트 전반에서 측정한, 첫 번째 오디오 출력 토큰을 생성하는 데 걸리는 평균 시간(초)입니다. TTFA는 음성 에이전트 애플리케이션의 체감 응답성을 보여 주는 핵심 지표입니다.

버전 기록

Artificial Analysis Speech to Speech Index v2.0

2026년 8월—현재

  • 지수에서 대화 역학(Full Duplex Bench)을 작업 성공률로 교체했습니다.
  • 네 구성 요소에 균등한 가중치 적용: 음성 추론(Big Bench Audio) 25%, 에이전트 성능(𝜏-Voice) 25%, Arena 선호도(Arena Score) 25%, 작업 성공률 25%입니다.

Artificial Analysis Speech to Speech Index v1.1

2026년 8월

  • Artificial Analysis Speech to Speech Index에 Speech Agent Arena를 추가했습니다.
  • 네 데이터 세트에 균등한 가중치 적용: 음성 추론(Big Bench Audio) 25%, 대화 역학(Full Duplex Bench) 25%, 에이전트 성능(𝜏-Voice) 25%, Speech Agent Arena 25%입니다.

Artificial Analysis Speech to Speech Index v1.0

2026년 6월—현재

  • 음성 추론, 대화 역학, 에이전트 성능 결과를 요구하는 가중 평균 점수인 Artificial Analysis Speech to Speech Index를 출시했습니다.
  • 세 데이터 세트에 동일한 가중치를 적용합니다. 음성 추론(Big Bench Audio) 33.3%, 대화 역학(Full Duplex Bench) 33.3%, 에이전트 성능(𝜏-Voice) 33.3%입니다.

Big Bench Audio (BBA) v1.2

2026년 5월—현재

  • 모델이 오답인 대안을 논의한 뒤 정답을 제시하는 경우를 비롯해 장황한 응답에서도 올바른 최종 답변을 더 안정적으로 인식하도록 심사 모델과 채점 하니스를 업데이트했습니다.

Big Bench Audio (BBA) v1.1

2026년 3월—2026년 5월

  • 모델이 답하지 않은 질문까지 포함한 1,000개 질문 중 정답 수로 정확도를 측정했습니다.
  • Claude Sonnet 4.6을 심사 모델로 사용했습니다.

Big Bench Audio (BBA) v1.0

2024년 12월—2026년 3월

  • 오류 없이 응답한 답변 중 정답의 비율로 정확도를 측정했으므로, 모델이 답하지 않은 질문에는 감점하지 않았습니다.
  • Claude Sonnet 3.5를 심사 모델로 사용했습니다.