텍스트 음성 변환 벤치마킹 방법론

범위 및 배경

Artificial Analysis는 서버리스 API 엔드포인트를 통해 제공되는 텍스트 음성 변환 모델을 벤치마킹합니다. 이 페이지에서는 품질 및 성능 벤치마킹을 포함한 텍스트 음성 변환 벤치마킹 방법론을 설명합니다. 고객이 액세스에 고정 요금을 지불하지 않고 사용량에 대해서만 지불하는 텍스트 음성 변환 엔드포인트를 서버리스로 간주합니다.

성능 벤치마킹과 Speech Arena 모두에서 서버리스 API를 사용하는 최종 사용자의 경험을 반영하는 데 중점을 둡니다. 오디오 파일을 로컬에서 수신하기까지 걸리는 시간을 벤치마킹합니다. API 응답이 바이트가 아닌 URL인 경우 파일 다운로드 시간을 응답 시간 측정에 포함합니다. 각 제공업체의 문서에서 권장하는 표준 API 구현을 사용합니다. 제공업체 API에서 설정할 수 있는 경우 오디오 샘플링 레이트를 22.05 kHz로 표준화합니다.

주요 지표

다음 지표를 사용하여 텍스트 음성 변환 모델의 품질, 성능, 가격을 추적합니다.

품질 Elo

Artificial Analysis Text to Speech Arena의 사용자 응답으로 결정된 모델의 상대적 Elo 점수입니다.

아직 충분한 투표를 받지 못한 일부 모델은 표시되지 않을 수 있습니다. Chatbot Arena에서 LMSYS가 Elo 점수를 계산하는 방식과 유사한 선형 회귀 모델을 사용합니다.

100만 자당 가격

모든 TTS 모델의 가격은 입력 텍스트 100만 자당 가격으로 표시합니다. 제공업체가 문자 단위로 직접 가격을 책정하지 않는 경우 다음과 같이 이에 상응하는 가격을 산출합니다.

  • 문자당: 게시된 요금을 그대로 사용
  • 구독 요금제: 100만 자 이상을 포함하는 최저가 요금제의 실효 요금 사용(가능한 경우 연간 요금제, 이용률 80% 가정)
  • 토큰 기반: 배치 가격을 사용해 문자를 입력 토큰으로 변환하고 오디오 출력 길이를 추정하여 산출
  • 출력 길이: 분당 150단어, 즉 분당 약 825자로 가정한 발화 속도를 사용해 변환
  • 바이트당: 영어 텍스트에서 UTF-8 1바이트는 문자 약 1개에 해당
  • 추론 시간: 약 500자로 구성된 텍스트 약 25개를 사용한 벤치마크 실행 결과로 추정
  • 오픈 웨이트: 상용 API 가격이 없으므로 가격 없이 표시
  • Speech to Speech 모델: 고정된 TTS Arena 프롬프트 20개의 음성 생성 비용에서 산출하며, 보고된 텍스트 입력, 출력 오디오, 출력 텍스트, 별도로 노출된 추론/사고 토큰을 기준으로 합니다. 오디오 응답의 일부로 보고되는 경우 출력 텍스트 토큰도 포함합니다. 프롬프트를 독립적인 단일 턴 요청으로 실행하여 캐싱이 가격에 미치는 영향이 미미하므로 캐싱 효과는 제외합니다.

가격을 표시할 때 일시적인 할인은 포함하지 않습니다.

생성 시간

입력 문자 약 500개로 오디오 클립 하나를 생성하는 데 제공업체가 걸린 시간의 중앙값으로, 최근 14일간의 측정치를 바탕으로 계산합니다.

오디오 응답 대신 URL이 제공되는 경우 생성 시간에 제공업체에서 오디오 클립을 다운로드하는 시간도 포함합니다. URL은 오디오 생성이 완료되기 전에 만들어질 수 있으므로, 생성된 오디오 클립을 수신할 때 최종 사용자가 경험하는 지연 시간을 반영하기 위한 것입니다. 해당하는 경우 배치 크기를 1로 설정하여 오디오 클립을 생성합니다.

벤치마킹은 매일 무작위 시간에 하루 4회 수행합니다. 각 벤치마킹 평가에서는 모델마다 무작위 음성 하나를 선택합니다. 각 생성 작업에 약 500자로 구성된 고유한 프롬프트를 사용합니다.

통제 음성

Controlled Voice Arena는 음성 복제를 사용하여 각 텍스트 음성 변환 모델을 평가하는 음성을 표준화합니다. 동일한 참조 음성으로 모델을 비교함으로써 특정 음성에 대한 청취자의 선호도를 음성의 자연스러움, 오디오 품질, 발음, 속도, 운율과 같은 보다 포괄적인 모델 품질 요소와 분리합니다. 이를 통해 기반 텍스트 음성 변환 모델을 더욱 동등한 조건에서 비교할 수 있습니다.

Controlled Voice Arena는 각 모델이 자체적으로 공개한 대표 음성 세트를 사용하여 평가하는 Provider Voice Arena를 보완합니다. 참조 세트는 전문적으로 녹음한 음성 8개, 즉 미국 여성 2명, 미국 남성 2명, 영국 여성 2명, 영국 남성 2명으로 구성됩니다. 아래에서 통제 음성을 선택하여 참조 녹음을 들어보세요.

제공업체 음성

Provider Voice Arena는 각 텍스트 음성 변환 모델의 제공업체가 제공하는 대표 음성 세트를 사용하여 모델을 평가합니다. 동일하게 복제한 참조 음성을 사용해 모델을 비교하는 Controlled Voice Arena를 보완합니다. 제공업체 음성은 사용자가 각 모델의 공개 API, 제품 인터페이스 또는 문서를 통해 일반적으로 경험하는 방식을 반영합니다.

각 모델의 비교가 대표성과 공정성을 갖도록 제공업체가 제공하는 여러 음성을 선택합니다. 남성과 여성, 미국과 영국 억양의 각 조합에서 음성 2개씩, 총 8개를 선택합니다. 특정 성별과 억양 조합을 사용할 수 없는 경우 Provider Voice Arena 평가에서 해당 조합을 제외합니다.

제공업체 인터페이스와 문서에서 얼마나 중요하게 다뤄지는지를 기준으로 음성을 선택하며, 특성이 중립적이지 않은 음성(예: 매우 강한 지역 억양)은 제외합니다. 사용할 수 있는 음성이 많을 경우 모델 개발사가 특정 음성의 사용을 요청할 수도 있습니다. 일반적으로 오픈 소스 모델처럼 제공업체 음성이 제공되지 않는 경우에는 전문 성우의 음성 클립을 음성 생성용 소스 파일로 사용합니다(샘플은 위의 통제 음성 참조).

아래에서 모델 개발사를 선택하여 각 모델에 현재 사용하는 제공업체 음성을 확인하세요.

모델 및 제공업체 포함 기준

최종 사용자가 텍스트 음성 변환 모델과 제공업체를 선택하는 데 도움이 되도록 인기 있고 성능이 우수한 모델과 제공업체를 분석하고 비교하는 것이 목표입니다. 이에 따라 '업계 중요도'와 경쟁력 있는 성능을 검증해 신규 모델과 제공업체의 포함 여부를 평가합니다. 현재 이 기준을 개선하고 있으며 모든 의견과 제안을 환영합니다. 모델 또는 제공업체를 제안하려면 문의 페이지를 통해 연락해 주세요.

벤치마킹은 매일 무작위 시간에 하루 4회 수행합니다. 각 벤치마킹 평가에서는 모델마다 무작위 음성 하나를 선택합니다. 각 생성 작업에 약 500자로 구성된 고유한 프롬프트를 사용합니다.

독립성 선언

벤치마킹은 엄격한 독립성과 객관성을 바탕으로 수행됩니다. Artificial Analysis에 등재하거나 유리한 결과를 제공하는 대가로 어떠한 제공업체로부터도 보상을 받지 않습니다.