텍스트 음성 변환 벤치마킹 방법론

범위 및 배경

Artificial Analysis는 주로 서버리스 API 엔드포인트를 통해 제공되는 텍스트 음성 변환 모델을 벤치마킹합니다. 이 페이지에서는 품질 및 성능 벤치마킹을 포함한 텍스트 음성 변환 벤치마킹 방법론을 설명합니다. 속도와 가격 지표에는 서버리스 엔드포인트가 필요합니다. 이를 제공하지 않는 모델도 품질 비교만을 위해 아레나에 포함될 수 있습니다.

성능 벤치마킹과 아레나 모두에서 서버리스 API를 사용하는 최종 사용자의 경험을 반영하는 데 중점을 둡니다. 각 제공업체의 문서에서 권장하는 표준 API 구현을 사용합니다.

주요 지표

다음 지표를 사용하여 텍스트 음성 변환 모델의 품질, 성능, 가격을 추적합니다.

품질 Elo

Artificial Analysis Text to Speech Arena의 사용자 응답으로 결정된 모델의 상대적 Elo 점수입니다. 순위는 쌍대 비교 투표를 최대우도법으로 적합한 Bradley-Terry 모델로 산출합니다. 점수는 아레나별로 모델 하나를 1000으로 고정해 기준점으로 삼고, 나머지 점수는 표준 Elo 척도에서 이에 대한 상대값으로 표시합니다. 비교가 어떻게 제시되고 투표가 이루어지는지는 아래의 아레나 작동 방식을 참고해 주세요.

대진 표집은 비교가 더 필요한 모델, 예를 들어 최근 등재된 모델이나 아직 점수가 없는 모델을 우선합니다. 그 덕분에 새 모델도 비교를 빠르게 쌓을 수 있습니다. 또한 한 모델의 비교 중 특정 상대가 차지할 수 있는 비중에는 상한을 두고, 추정 단계에서는 자주 반복된 조합의 대결에 더 낮은 가중치를 적용해 특정 대진이 모델의 점수를 좌우하지 않도록 합니다. 자체 실험에서 Provider Voice Arena와 Controlled Voice Arena 모두 순위는 이 가중치의 강도에 민감하지 않았습니다.

각 보드는 독립적으로 적합합니다. 종합 점수는 대상이 되는 모든 투표를 사용하며, 카테고리별, 억양별, 언어별 보드는 종합 결과를 집계한 것이 아니라 각자의 부분집합에 대해 따로 적합한 결과입니다. 보드 이력에 포함된 대상 투표는 모두 동일한 가중치로 반영되며, 시간 가중치나 최신성 감쇠는 적용하지 않습니다. 점수는 전체 투표 기록을 바탕으로 하루에 여러 차례 다시 계산하며 공개 전에 검토합니다. 95% 신뢰구간과 순위 범위를 함께 표시하고, 모델은 반올림하지 않은 Elo 순으로 정렬합니다. 아직 충분한 투표를 받지 못한 일부 모델은 표시되지 않을 수 있습니다.

Pronunciation Robustness

Pronunciation Robustness 벤치마크는 Text to Speech 모델이 어려운 텍스트를 올바르게 발음하는지 측정합니다. 고정된 챌린지 문장 세트의 발음으로 각 모델을 채점하고 인간 검토자가 허용 발음 기준으로 판정함으로써 Arena 선호도 결과를 보완합니다.

모든 모델은 고정된 단일 미국 영어 보이스로 동일한 세트를 읽습니다. 각 문장에는 미국 및 영국 영어에서 유효한 변형을 포함해 허용 발음이 정의된 강조 구간이 하나 이상 포함됩니다. 클립은 모델 이름 없이 무작위 순서로 검토자에게 제공됩니다. 프롬프트는 저희 측 정규화 없이 작성된 그대로 각 모델에 전송됩니다. 모델이 텍스트 정규화 설정을 제공하는 경우 기본값을 사용합니다.

이 세트는 네 가지 발음 챌린지 카테고리를 다룹니다:

  • Contextually Appropriate (Contextual Disambiguation): 철자는 같지만 문맥에 따라 다르게 읽히는 단어. 예: a wound that is bandaged와 a bandage that is wound.
  • Expanding Shorthand (Text Normalization): 숫자, 날짜, 단위, 표기를 자연스럽게 읽기. 예: 6'2", Chapter XVII, 1 tsp of sugar.
  • Preserving Exact Sequences (Sequence Fidelity): 코드, 경로, 이메일, 식별자를 정확히 읽기. 예: .env.local, a.chen@ucsf.edu.
  • Standalone Terms (Term Pronunciation): 브랜드명, 지명, 전문 용어를 올바르게 발음하기. 예: Arkansas, façade, genre.

공개되는 각 모델에서는 클립의 95% 이상을 세 명 이상의 제3자 검토자가 판정합니다. 강조 구간마다 자연스럽고 올바르게 발음되었는지 예, 아니요, 판별할 수 없음 중 하나로 답합니다. 모델 점수는 예와 아니요의 합계 대비 예의 비율입니다. "판별할 수 없음" 응답은 분모에서 제외됩니다. 카테고리 점수는 해당 카테고리의 구간에 동일한 공식을 적용합니다. 오차 막대는 95% 신뢰구간을 나타내며, 각 구간을 여러 검토자가 판정하므로 구간 단위로 클러스터링한 표준오차로 계산합니다.

세트 내 샘플의 95% 이상이 세 명 이상의 승인된 검토자로 커버되면 해당 모델의 결과를 공개합니다.

검토자에게 표시되는 평가 카드 예시와 벤치마크에 포함된 모든 모델의 예시 클립은 Pronunciation Robustness 개요에서 확인하세요.

100만 자당 가격

모든 TTS 모델의 가격은 입력 텍스트 100만 자당 가격으로 표시합니다. 제공업체가 문자 단위로 직접 가격을 책정하지 않는 경우 다음과 같이 이에 상응하는 가격을 산출합니다.

  • 문자당: 게시된 요금을 그대로 사용
  • 구독 요금제: 100만 자 이상을 포함하는 최저가 요금제의 실효 요금 사용(가능한 경우 연간 요금제, 이용률 80% 가정)
  • 토큰 기반: 배치 가격을 사용해 문자를 입력 토큰으로 변환하고 오디오 출력 길이를 추정하여 산출
  • 출력 길이: 분당 150단어, 즉 분당 약 825자로 가정한 발화 속도를 사용해 변환
  • 바이트당: 영어 텍스트에서 UTF-8 1바이트는 문자 약 1개에 해당
  • 추론 시간: 약 500자로 구성된 텍스트 약 25개를 사용한 벤치마크 실행 결과로 추정
  • 오픈 웨이트: 가격 없이 표시하되, 해당 모델이 유료 API로도 제공되는 경우에는 그 요금을 사용
  • Speech to Speech 모델: 고정된 TTS Arena 프롬프트 20개의 음성 생성 비용에서 산출하며, 보고된 텍스트 입력, 출력 오디오, 출력 텍스트, 별도로 노출된 추론/사고 토큰을 기준으로 합니다. 오디오 응답의 일부로 보고되는 경우 출력 텍스트 토큰도 포함합니다. 프롬프트를 독립적인 단일 턴 요청으로 실행하여 캐싱이 가격에 미치는 영향이 미미하므로 캐싱 효과는 제외합니다.

처리량

제공업체가 1초당 음성으로 변환하는 입력 텍스트 문자 수의 중앙값으로, 최근 3일간의 측정값을 기준으로 산출합니다. 생성할 때마다 프롬프트의 문자 수를 클립을 생성하고 수신하는 데 걸린 시간으로 나누어 구합니다.

오디오 응답 대신 URL이 제공되는 경우, 측정값에는 제공업체로부터 오디오 클립을 내려받는 시간도 포함합니다. URL은 오디오 생성이 완료되기 전에 발급될 수 있으므로, 생성된 오디오 클립을 최종 사용자가 실제로 받기까지의 경험을 반영하기 위해서입니다. 해당되는 경우 오디오 클립은 배치 크기 1로 생성합니다.

벤치마킹은 하루에 4회 수행합니다. 각 벤치마킹 평가에서는 모델마다 무작위 음성 하나를 선택합니다. 각 생성 작업에 약 500자로 구성된 고유한 프롬프트를 사용합니다.

아레나 작동 방식

각 비교에서는 동일한 텍스트 프롬프트로 생성한 오디오 클립 두 개를 제시합니다. Provider Voice Arena에서는 두 클립 모두 같은 성별과 억양 범주의 음성을 사용하고, Controlled Voice Arena에서는 두 클립 모두 같은 복제 참조 음성을 사용합니다. 모델 이름은 투표 후까지 공개되지 않으며, 제시 순서는 무작위로 정해집니다. 또한 각 클립을 일정 부분 이상 재생해야 투표가 활성화됩니다. 투표는 무승부 없는 양자택일입니다. 프롬프트는 네 가지 범주(고객 서비스, 엔터테인먼트, 지식 공유, 어시스턴트)에 걸쳐 있으며 영숫자 문자열과 숫자 나열 같은 난이도 높은 자료도 포함하고, 프롬프트 세트는 주기적으로 갱신합니다.

오디오 샘플은 모델마다 한 번만 생성해 표준화한 뒤 아레나에 투입합니다. 따라서 특정 모델에 대한 투표는 공개 전에 점검과 정규화를 마친 일관된 샘플 세트를 대상으로 이루어집니다. 클립은 동일한 재생 포맷으로 변환하고 공통 음량 목표에 맞춰 정규화하므로, 제공업체 간 음량이나 인코딩 차이가 투표에 영향을 주지 않습니다.

Controlled Voice Arena

Controlled Voice Arena는 음성 복제를 사용하여 각 텍스트 음성 변환 모델을 평가하는 음성을 표준화합니다. 동일한 참조 음성으로 모델을 비교함으로써 특정 음성에 대한 청취자의 선호도를 음성의 자연스러움, 오디오 품질, 발음, 속도, 운율과 같은 보다 포괄적인 모델 품질 요소와 분리합니다. 이를 통해 기반 텍스트 음성 변환 모델을 더욱 동등한 조건에서 비교할 수 있습니다.

Controlled Voice Arena의 영어 참조 세트는 전문적으로 녹음한 음성 8개, 즉 미국 여성 2명, 미국 남성 2명, 영국 여성 2명, 영국 남성 2명으로 구성됩니다. 모델이 전체 참조 녹음을 허용하는 경우, 자체적으로 녹음을 잘라 사용하는 모델을 포함해 전체 녹음을 제공합니다. 모델이 참조 오디오 길이를 제한하는 경우에는 일반적으로 5~10초 또는 10~15초 길이의 짧은 버전을 자연스러운 쉼 지점에서 잘라 제공합니다.

Controlled Voice Arena는 영어 외에도 스페인어, 프랑스어, 독일어, 포르투갈어, 일본어, 힌디어, 표준 중국어, 아랍어, 베트남어로 모델을 평가합니다. 각 비영어 언어의 참조 세트에는 원어민이 전문적으로 녹음한 남성 음성 1개와 여성 음성 1개가 포함됩니다. 각 언어 안에서도 음성 복제를 사용해 음성을 표준화하며, 선호도 투표는 평가 대상 언어가 제1언어인지 확인하는 선별을 거친 평가자로부터 수집합니다. 각 모델은 지원하는 언어에서만 평가되며, 모델들이 안정적인 Elo 평점을 산출하기에 충분한 비교를 축적하면 언어별 리더보드가 공개됩니다.

Controlled Voice Arena는 각 모델이 자체적으로 공개한 대표 음성 세트를 사용하여 평가하는 Provider Voice Arena를 보완합니다.

아래에서 통제 음성을 선택하여 참조 녹음을 들어보세요.

Provider Voice Arena

Provider Voice Arena는 각 텍스트 음성 변환 모델의 제공업체가 제공하는 대표 음성 세트를 사용하여 모델을 평가합니다. 동일하게 복제한 참조 음성을 사용해 모델을 비교하는 Controlled Voice Arena를 보완합니다. 제공업체 음성은 사용자가 각 모델의 공개 API, 제품 인터페이스 또는 문서를 통해 일반적으로 경험하는 방식을 반영합니다.

각 모델의 비교가 대표성과 공정성을 갖도록 제공업체가 제공하는 여러 음성을 선택합니다. 남성과 여성, 미국과 영국 억양의 각 조합에서 음성 2개씩, 총 8개를 선택합니다. 특정 성별과 억양 조합을 사용할 수 없는 경우 Provider Voice Arena 평가에서 해당 조합을 제외합니다.

제공업체 인터페이스와 문서에서 얼마나 중요하게 다뤄지는지를 기준으로 음성을 선택하며, 특성이 중립적이지 않은 음성(예: 매우 강한 지역 억양)은 제외합니다. 사용할 수 있는 음성이 많을 경우 모델 개발사가 특정 음성의 사용을 요청할 수도 있습니다. 일반적으로 오픈 소스 모델처럼 제공업체 음성이 제공되지 않는 경우에는 전문 성우의 음성 클립을 음성 생성용 소스 파일로 사용합니다(샘플은 위의 Controlled Voice Arena 참조).

아래에서 모델 개발사를 선택하여 각 모델에 현재 사용하는 제공업체 음성을 확인하세요.

투표자 품질

당사가 공개하는 평가의 대부분은 유사 프로젝트 수행 실적이 우수한 유급 패널에서 나오며, 아레나 선호도 투표와 Pronunciation Robustness 검토를 모두 포함합니다. 영어 아레나와 Pronunciation Robustness의 경우 미국 또는 영국에 거주하는 영어 원어민으로 패널을 선별합니다. Controlled Voice Arena의 영어 이외 언어에서는 제1언어를 기준으로 선별하고 가능한 경우 출신 국가에 거주하는 평가자를 대상으로 해, 평가 대상 언어의 원어민이 평가하도록 합니다.

Pronunciation Robustness 세션에는 정답이 알려진 어텐션 체크 클립이 포함되며, 응답한 체크를 하나라도 틀린 검토자는 완전히 제외됩니다. 아레나 투표는 순위에 반영되기 전에 자동 품질 선별을 거칩니다. 유급 평가자에게는 모델 이름이 표시되지 않습니다. 또한 유급 풀과 공개 풀의 순위를 지속적으로 비교해 일관성을 확인합니다.

모델 및 제공업체 포함 기준

최종 사용자가 텍스트 음성 변환 모델과 제공업체를 선택하는 데 도움이 되도록 인기 있고 성능이 우수한 모델과 제공업체를 분석하고 비교하는 것이 목표입니다. 이에 따라 '업계 중요도'와 경쟁력 있는 성능을 검증해 신규 모델과 제공업체의 포함 여부를 평가합니다. 현재 이 기준을 개선하고 있으며 모든 의견과 제안을 환영합니다. 모델 또는 제공업체를 제안하려면 문의 페이지를 통해 연락해 주세요. 제공업체가 모델의 중요한 업데이트를 공개하면 날짜가 표기된 새 변형으로 등재하고, 아레나 샘플을 모두 다시 생성한 뒤 기존 투표를 이어받지 않고 순위를 매깁니다. 이전 변형도 요건을 충족하는 동안에는 계속 게재합니다.

독립성 선언

벤치마킹은 엄격한 독립성과 객관성을 바탕으로 수행됩니다. Artificial Analysis에 등재하거나 유리한 결과를 제공하는 대가로 어떠한 제공업체로부터도 보상을 받지 않습니다.