음성 텍스트 변환 벤치마킹 방법론

Artificial Analysis는 자동 음성 인식(ASR) 모델이라고도 하는 음성 텍스트 변환(STT) 모델을 정확도, 속도, 가격 기준으로 평가합니다. 비스트리밍(오프라인/일괄 처리라고도 함) 전사와 스트리밍 전사를 모두 벤치마킹합니다. 정확도(WER), 정규화, 데이터 세트, 모델 포함 기준은 두 방식에 공통으로 적용됩니다. 아래에서는 먼저 이러한 공통 기반을 정의한 다음, 일괄 처리 및 스트리밍 평가에 특화된 지표를 각각 설명합니다.

주요 지표

단어 오류율(WER)

단어 오류율(WER)은 모델 출력을 기준 전사본(검증된 사람의 전사본)과 비교해 전사 정확도를 측정합니다.

수식:

WER = (Substitutions + Insertions + Deletions) ÷ Words in Reference

예시:

  • 기준: the cat sat on the mat
  • 가설: cat is on the big mat
  • 오류: 삭제(the), 대체(sat → is), 삽입(big)
  • WER = 3 ÷ 6 = 50%

자세한 내용은 단어 오류율(WER) 평가 섹션을 참조하세요.

속도 계수(일괄 처리)

일괄 처리 전사 API가 실제 오디오 길이에 비해 얼마나 빠르게 오디오를 전사하는지 나타냅니다.

  • 값이 1보다 크면 서비스가 실시간보다 빠르게 전사한다는 뜻입니다(예: 2.0이면 10분 분량의 오디오를 5분 안에 전사할 수 있음).

일괄 처리 벤치마크에는 네트워크 지연 시간이 포함됩니다. 시간 경과에 따른 속도 계수의 각 점은 24시간 내에 무작위로 실시한 네 차례 측정값의 중앙값입니다. 속도 계수의 막대는 최근 7일간의 중앙값입니다.

수식:

Speed Factor = Audio Duration ÷ API Response Time

지연 시간 지표(스트리밍)

스트리밍 모델에는 다음 두 가지 지연 시간 지표를 제공합니다:

  • 최종 전사본 도달 시간: SileroVAD가 발화 종료를 감지한 후 공유된 전사본 중 처음으로 Final로 표시된 전사본까지 걸린 시간입니다.
  • 첫 부분 전사본 도달 시간: SileroVAD가 발화 종료를 감지한 후 공유된 전사본 중 처음으로 Partial로 표시된 전사본까지 걸린 시간입니다.

측정에 관한 자세한 내용은 스트리밍 음성 텍스트 변환 섹션을 참조하세요.

1,000분당 가격

서로 다른 청구 모델을 사용하는 제공업체 간에 정규화한 오디오 1,000분 전사의 예상 비용입니다.

계산 방법

  • 오디오 길이: 제공업체가 공개한 오디오 길이 기반 전사 가격을 사용합니다.
  • 처리 시간: 다양한 오디오 샘플의 처리 시간을 벤치마킹하고, 처리 시간에 따른 요금을 오디오 1,000분당 비용으로 환산합니다.
  • 토큰: 대표 오디오 샘플의 청구 대상 토큰 사용량을 벤치마킹하고, 관측된 지출을 오디오 1,000분당 비용으로 환산합니다. 제공업체가 추론 토큰을 별도로 공개하는 경우 이를 명시적으로 포함합니다. 그렇지 않으면 청구 대상 출력 토큰에 사용자에게 보이는 출력과 내부 추론 토큰이 모두 포함될 수 있습니다.
  • 구독 요금제: 제공업체가 명시한 한도 내에서 한 달에 1,000분의 전사를 현실적으로 지원할 수 있는 요금제 중 선결제 금액이 가장 낮은 요금제를 사용합니다.

공통 단위

모든 경우에 가격은 전사한 오디오 1,000분당 예상 비용이라는 동일한 단위로 환산됩니다.

단어 오류율(WER) 평가

Artificial Analysis는 모든 모델-제공업체 조합을 대상으로 독립적인 WER 테스트를 실시합니다.

주요 세부 정보:

  • 최종 사용자 환경의 성능을 반영하기 위해 API 엔드포인트를 직접 테스트합니다.
  • 현재 평가: AA-AgentTalk, VoxPopuli-Cleaned-AA, Earnings22-Cleaned-AA에서 약 8시간 분량의 오디오를 사용합니다(자세한 내용은 아래 참조). 각 데이터 세트의 결과는 시간 가중 평균으로 계산한 후 AgentTalk 50%, VoxPopuli 25%, Earnings22 25%의 가중 평균을 구해 AA-WER 결과를 산출합니다.
  • 모델이 프롬프트를 지원하는 경우 다음을 제공합니다: "Transcribe the audio verbatim, outputting only spoken words in sequence."

데이터 세트

  1. AA-AgentTalk (독점, 홀드아웃): Artificial Analysis가 개발한 독점 평가 데이터 세트로, 음성 에이전트 사용 사례와 관련된 발화에 중점을 둡니다. 자세한 내용은 블로그 게시물을 참조하세요.

    • 샘플 수: 469개
    • 샘플 길이 범위: 8~109초
    • 총 길이: 약 250분
  2. VoxPopuli-Cleaned-AA: 유럽 의회 회의 발언입니다.

    • 하위 집합: 영어
    • 샘플 수: 628개
    • 샘플 길이 범위: 5~38초
    • 총 길이: 약 119분
  3. Earnings22-Cleaned-AA: 전문 용어와 발화자 간 겹침이 포함된 기업 실적 발표 통화입니다.

    • 샘플 수: 6개
    • 샘플 길이 범위: 약 14~22분
    • 총 길이: 약 115분

VoxPopuli-Cleaned-AA와 Earnings22-Cleaned-AA에 관한 자세한 내용은 블로그 게시물을 참조하세요. 두 저장소의 현재 정제 전사본 릴리스는 버전 1.0이며, AA-WER v2에 사용됩니다.

이 정제 전사본은 수동 검토와 데이터 세트 전반의 교차 검증을 바탕으로 축어적 정답 데이터를 만들기 위해 최선을 다한 결과입니다. 향후 개선 사항은 후속 버전으로 공개할 예정입니다. 문제를 발견하면 문의 페이지 또는 Discord를 통해 의견을 보내 주세요.

오디오 청킹(Earnings22)

Earnings22에는 길이가 더 긴 파일(약 14~22분)이 포함되어 있어 평가 방식과 모델 구성에 따라 청킹 방식이 달라집니다. 비스트리밍 전사(일괄 처리/오프라인)의 경우 기본적으로 전체 원본 오디오를 평가합니다. 모델 또는 API 제한으로 더 짧은 입력이 필요하거나 잘림/시간 초과를 피해야 할 때는 Earnings22를 먼저 약 9분 길이의 청크로 나누고, 필요한 경우에만 약 30초 길이까지 줄입니다. 스트리밍 전사의 경우 대부분의 Earnings22 실행에서 약 30초 길이의 청크를 사용하고 결과를 원본 통화 단위로 다시 집계합니다. 일부 스트리밍 구성은 제공업체 엔드포인트의 동작과 더 잘 부합하는 경우 전체 원본 오디오로 평가합니다. 단어 중간이 잘리지 않도록 가능한 경우 발화 경계에 청크 경계를 배치합니다. AA-AgentTalk과 VoxPopuli 샘플은 충분히 짧아 청킹을 적용하지 않습니다.

청크로 나눈 Earnings22 오디오의 결과는 원본 통화 단위로 다시 집계합니다:

  • WER: 청크 전사본을 원본 통화 단위로 다시 연결하고, 결합된 전사본을 원본 통화의 정답 데이터와 비교해 WER을 계산합니다. 그런 다음 다른 모든 데이터 세트와 마찬가지로 원본 통화 간 오디오 길이 가중 방식으로 WER을 집계합니다.
  • 스트리밍 지연 시간: 최종 전사본 도달 시간과 첫 부분 전사본 도달 시간은 청크 전체의 단순 평균으로 집계합니다.

오디오 샘플

"Fantastic, the blog post about remote work best practices is ready to publish. The interview quotes from our distributed team members add authenticity, and the productivity statistic from Buffer's study support our main points. Schedule it for Tuesday at ten AM and promote it across our social channels. This should drive good engagement with our HR software prospects."

"I'd like to speak with someone about setting up a payment plan for my outstanding balance. My account has been past due for about two months now. The account is A A C, excuse me, A C C nine nine five two seven."

"Also can you adjust the Philips Hue bulbs in the dining room to that warm amber setting turn down the chandelier to about thirty percent brightness?"

원본: "Mr President, I have another complaint about this procedure, which is that it is not secret."

정제본: "Thank you Mr President, I have another complaint about this procedure, which is that it's not secret."

원본: "Furthermore the AFET opinion divides eligible countries into candidate, potential candidate, neighbourhood and in exceptional and duly justified circumstances strategically important third counties."

정제본: "Furthermore, the opinion of AFET divides eligible countries into candidate, potential candidate, neighbourhood and, in exceptional and duly justified circumstances, strategically important third countries."

"Thank you, Darcy, and welcome everyone to our December quarterly analyst call. December quarterly production showed a considerable improvement on the September quarter with record production throughput and improving grades, improving recoveries and improving cash flow. Unfortunately, delays accessing higher grade parts of the open pit resulted in lower grades than projected in our guidance. On the exploration front, today we announced a 70% increase in our 100% owned Yamarna resources. So they now sit at 0.5 million ounces..."

정규화 과정

비교하기 전에 기준 전사본(정답 데이터)과 모델 전사 가설을 모두 OpenAI의 Whisper 정규화 도구로 정규화합니다:

  • 모든 텍스트를 소문자로 변환하고 대괄호 안의 텍스트와 간투사("uh", "um")를 제거한 후 공백을 정규화
  • 축약형 확장(won't vs. will not, I'm vs. I am)
  • 숫자 표기 표준화(twenty five vs. 25, two point five vs. 2.5)
  • 문장 부호/기호 정규화(의미가 없는 기호 제거, 통화/백분율 표준화)
  • 철자 표준화(예: colour vs. color)

OpenAI의 Whisper 정규화 도구에 더해 다음과 같은 정규화도 추가했습니다:

  • 동일한 숫자, ID, 전화번호를 붙여 쓰거나, 띄어 쓰거나, 괄호 또는 하이픈으로 묶은 형식 정규화(예: 1405 553 272 vs. 1405553272, (303) 775-4498 vs. 303 775 4498, CLM-2024-0873 vs. CLM 2024 0873)
  • 구분자 형식이 다른, 글자 단위로 분리한 이름과 철자를 읽은 글자 시퀀스 정규화(예: S I N G H vs. S-I-N-G-H, A B C vs. A-B-C)
  • 앞자리 0 보존 및 동일한 기호의 발화 형식 정규화(예: 06100052, + vs. plus, engagement underscore rate vs. engagement_rate)
  • 동일한 시각 표기의 형식 정규화(예: 7:00pm vs. 7pm, 10:30 AM vs. ten thirty AM)
  • 미국/영국 영어 철자의 추가 동등성 반영(예: totalled vs totaled)
  • 데이터 세트에서 모호한 고유 명사의 허용 가능한 동등 철자 반영(예: Mateo vs. Matteo)
  • 범위의 양 끝값과 단위가 일치하는 숫자 범위의 형식 정규화(예: 15-20 minutes vs. fifteen to twenty minutes, 6-8% vs. six to eight percent)
  • 의미가 변하지 않는 일반적인 띄어쓰기 및 하이픈 표기 변형 정규화(예: hard-coded vs. hardcoded, up front vs. upfront, Sea-Tac vs. SeaTac)
  • 누락 또는 대체 시 전사 의미가 달라지는 코드와 기호 보존(예: F-150, W-2, $50, 5%)
  • 반복해서 발화된 큰 수 표현은 새로운 숫자로 합치지 않고 별도로 유지(예: twelve million twelve million은 24,000,000이 아니라 12,000,000 12,000,000으로 변환)
  • 대괄호 안에 전사된 내용은 유지하되 [music], '<unk>', language English'<asr_text>' 같은 주석 태그는 제거

예시:

  • 정답 데이터: Hello, I'm Dr. Smith. I have twenty-five patients today.
  • 모델 출력: hello i am doctor smith i have 25 patients today
  • 정규화 후: hello i am doctor smith i have 25 patients today

WER 계산

  • WER은 한 시퀀스를 다른 시퀀스로 변환하는 데 필요한 최적의 대체, 삽입, 삭제 횟수를 찾아 두 시퀀스를 정렬하는 레벤슈타인 거리를 기반으로 합니다.
  • 여기서는 모델의 전사본(가설)을 검증된 사람의 전사본(기준)으로 되돌리는 데 필요한 편집 횟수를 측정합니다.
  • 짧은 클립이 많다는 이유로 긴 파일에 비해 결과가 치우치지 않도록 데이터 세트 내 결과는 오디오 길이 가중 평균 WER로 집계합니다.

스트리밍 음성 텍스트 변환

스트리밍 벤치마크는 특히 음성 에이전트 사용 사례에서 스트리밍 모델의 정확도를 보여 주면서 위의 일괄 처리 벤치마크와 비교 가능하도록 구성됩니다. WER, 정규화, 데이터 세트, 가중치, 오디오 청킹은 위에 정의된 방식을 따릅니다. 최종 전사본 WER과 발화 종료 후 첫 부분 전사본의 부분 전사본 WER을 별도로 제공합니다.

스트리밍에서는 각 데이터 세트 내 지연 시간 지표를 샘플 가중 방식으로 집계하고, WER은 오디오 길이 가중 방식을 유지합니다. 청크로 나눈 Earnings22 오디오는 위의 청킹 집계 참고 사항을 참조하세요.

스트리밍 동작 방식

오디오는 20ms 청크 단위로 실시간 스트리밍하거나 공개된 모델 구성의 권장 방식에 따라 스트리밍합니다. 스트리밍 STT 모델은 두 가지 유형의 전사본을 반환합니다:

  • 부분 전사본: 아직 확정되지 않아 변경될 수 있습니다.
  • 최종 전사본: 확정되어 더 이상 변경되지 않습니다.

모든 지연 시간 측정에는 네트워크 지연이 포함됩니다. 이는 독점 모델의 실제 최종 사용자 경험을 반영하며, 제공업체 간 표준화를 어렵게 만들 수 있습니다.

강제 엔드포인팅

대부분의 모델에서는 별도의 VAD가 발화 종료를 감지했을 때처럼 특정 시점에 최종 전사본 생성을 트리거할 수 있습니다. 이는 음성 에이전트 개발자가 별도로 조정한 엔드포인팅 모델을 실행해 전사본을 얼마나 적극적으로 가져올지 제어하는 경우가 많기 때문에 중요합니다. 강제 엔드포인팅을 지원하는 모델은 아래의 표준 경로로 평가하고, 지원하지 않는 모델은 대체 로직으로 평가합니다(아래의 타이밍 로직 세부 정보 참조).

제공업체가 엔드포인팅 관련 구성을 제공하는 경우 강제 엔드포인팅 신호만 최종 전사본을 트리거하도록 설정하고, 이 사용 사례에 대해 제공업체가 공개적으로 권장하는 구성을 사용합니다.

타이밍 로직: 강제 엔드포인팅 지원

  • 오디오를 실시간으로 스트리밍합니다. SileroVAD가 발화 종료를 감지하면 force-endpoint 요청을 보냅니다.
  • 최종 전사본 도달 시간 타이머는 오디오 파일의 발화 종료 타임스탬프가 아니라, 발화 종료 지점까지의 오디오가 실제로 스트리밍되고 force-endpoint 신호가 전송된 벽시계 시점에 시작됩니다. 이를 통해 테스트 하니스 또는 모델 측의 페이싱 오차가 지연 시간에 섞이는 것을 방지합니다.
  • 모델에서 다음 최종 전사본이 도착하면 타이머가 멈추며, 결합된 최종 전사본을 기준으로 WER을 계산합니다.
  • SileroVAD가 작동하기 전에 모델이 이미 최종 전사본을 공유했다면 가장 최근 전사본을 사용합니다.
  • 첫 부분 전사본 도달 시간도 같은 방식으로 측정하며, force-endpoint 신호 후 처음 수신한 부분 전사본에서 측정을 종료합니다.

타이밍 로직: 강제 엔드포인팅 미지원

  • SileroVAD가 감지한 발화 종료 후 2초 이내의 첫 자연 최종 전사본을 사용합니다.
  • 2초 이내에 자연 최종 전사본이 나타나지 않으면 2초 후 도착한 첫 부분 전사본을 사용합니다.
  • 2초 후에도 아무것도 도착하지 않으면 2초 전에 도착한 가장 최근 부분 전사본을 사용합니다.

보고 지표

최종 WER은 결합된 최종 전사본에 위 로직으로 선택된 최종 전사본 또는 대체 부분 전사본을 더해 계산합니다. 부분 WER은 결합된 최종 전사본에 위 로직으로 선택된 엔드포인팅 후 부분 전사본을 더해 계산합니다. 둘 다 전체 정답 전사본과 비교합니다. 엔드포인팅 후 첫 부분 전사본은 일반적으로 모델의 스트리밍 출력에서 더 이른 시점을 반영하므로, 부분 WER과 최종 WER은 직접 비교하지 않고 별도로 제공합니다.

모델 포함 기준

최종 사용자가 사용할 모델과 제공업체를 선택할 수 있도록 가장 인기 있고 성능이 뛰어난 음성 텍스트 변환 모델을 소개하는 것이 목표입니다. 따라서 신규 모델 및 제공업체의 포함 여부를 평가할 때 '업계 중요도'와 경쟁력 있는 성능 기준을 적용합니다. 현재 이러한 기준을 개선하고 있으며 모든 의견과 제안을 환영합니다. 모델을 제안하려면 문의 페이지를 통해 연락해 주세요.

버전 기록

AA-WER v2.2

2026년 5월~현재

  • 영어 텍스트 비교 정규화 도구를 한층 더 개선하여 의미를 보존하는 추가 전사 변형을 동등하게 취급하면서도, 의미가 있는 요소의 누락 또는 대체에는 감점을 유지하도록 했습니다:
    • 동일한 표현에서의 유니코드 아포스트로피 변형(예: we’re vs. we're)
    • 의미가 일치하는 부호 있는 백분율 표기(예: -12% vs. negative twelve percent)
    • 통화 기호가 없는 경우의 소수 그룹화(예: 99.99 vs. ninety-nine ninety-nine). 단, 통화 기호가 누락된 경우에는 감점 유지(예: $71.50과 seventy-one fifty는 동등하지 않음)
    • 형식만 다른 하이픈/대시 변형(예: 18-year-old vs. 18 year old)
    • 명확한 코드, URL, 이메일 문맥에서의 기술적 문장 부호(예: UserController.java vs. UserController dot java, /v1/users vs. slash v1 slash users, gmail.com vs. gmail dot com)
    • 발화 형식과 표기 형식이 일치하는 버전, 소수, 분수 변형(예: version 1.24.3 vs. version one point twenty-four dot three, 1.0 vs. one point zero, 1.25 inches vs. one and a quarter inches)
    • 의미가 변하지 않는 단위 약어(예: mg/dL vs. milligrams per deciliter, GB vs. gigabytes)
  • 스트리밍 음성 텍스트 변환 평가를 출시하고 최종 전사본 도달 시간과 첫 부분 전사본 도달 시간 지연 지표를 추가했습니다.

AA-WER v2.1

2026년 4월~2026년 5월

  • 영어 텍스트 비교 정규화 도구를 개선하여 의미를 보존하는 추가 전사 변형을 동등하게 취급하면서도, 의미가 있는 요소의 누락 또는 대체에는 감점을 유지하도록 했습니다:
    • 하이픈 또는 공백을 숫자 그룹화에만 사용한 ID 및 전화번호 형식(예: 303-775-4498 vs. 303 775 4498, CLM-2024-0873 vs. CLM 2024 0873)
    • 구분자 형식이 다른, 글자 단위로 분리한 이름과 철자를 읽은 글자 시퀀스(예: S I N G H vs. S-I-N-G-H)
    • 범위의 양 끝값과 단위가 일치하는 숫자 범위 형식(예: 15-20 minutes vs. fifteen to twenty minutes, 6-8% vs. six to eight percent)
    • 의미가 변하지 않는 일반적인 띄어쓰기 및 하이픈 표기 변형(예: hard-coded vs. hardcoded, up front vs. upfront, Sea-Tac vs. SeaTac)
    • 누락 또는 대체 시 전사 의미가 달라지는 코드와 기호 보존(예: F-150, W-2, $50, 5%)
    • 반복해서 발화된 큰 수 표현은 새로운 숫자로 합치지 않고 별도로 유지(예: twelve million twelve million은 24,000,000이 아니라 12,000,000 12,000,000으로 변환)
    • 대괄호 안에 전사된 내용은 유지하되 [music], '<unk>', language English'<asr_text>' 같은 주석 태그는 제거

AA-WER v2.0

2026년 2월~현재

  • 음성 에이전트 사용 사례에 중점을 둔 새로운 독점 평가 데이터 세트 AA-AgentTalk(가중치 50%)을 도입해 비공개 홀드아웃 테스트 세트로 사용했습니다.
  • VoxPopuli와 Earnings22의 정답 전사본을 정제하고 기준 전사본의 오류를 수정해 평가의 공정성을 높였습니다.
  • 전사본 품질 문제로 AMI SDM을 벤치마크에서 제외했습니다.
  • Whisper 영어 정규화 도구를 기반으로 한 사용자 지정 정규화 도구를 사용해 실제 전사 오류가 아닌 형식 차이로 인해 WER이 인위적으로 높아지는 현상을 줄였습니다.
  • 새 가중치: AA-AgentTalk 50%, Earnings22-Cleaned-AA 25%, VoxPopuli-Cleaned-AA 25%.

AA-WER v1.0

2025년 9월~2026년 2월

  • 세 가지 공개 데이터 세트 AMI SDM, VoxPopuli, Earnings22로 첫 버전을 출시했습니다.
  • 세 데이터 세트에서 약 6시간 분량의 오디오를 사용했습니다.