최고의 제공자 음성 텍스트 음성 변환(TTS) 모델

각 모델에서 제공하는 자체 음성을 사용할 수 있는 경우 이를 사용해 음성 생성 모델의 품질, 속도, 가격을 비교합니다.

자세한 내용은 방법론 페이지를 참고하세요.

품질

제공업체 음성 아레나 품질 Elo

Arena Elo: average Elo rating of the model · Higher is better

Relative Elo score of the models as determined by responses from users in Artificial Analysis' Speech Arena. Some models may not be shown due to not yet having enough votes.

가격

가격

Price: USD per 1M characters of text · Lower is better

Price per 1M characters of text. For detail on how we calculate price for providers which price based on inference time or subscription plans, see our methodology page.

속도 계수

초당 문자 수

Characters processed per second: # of characters per second of generation time · Higher is better

Number of characters processed per second of generation time. Higher values indicate faster generation speeds.

자주 묻는 질문

현재 Artificial Analysis 텍스트 음성 변환 모델 비교에서 품질이 가장 높은 모델은 Sonic 3.6이며, 품질 Elo는 1282입니다. Sonic 3.6 보기

현재 대표 API 엔드포인트 비교에서 가장 빠른 텍스트 음성 변환 모델은 Polly Standard이며, Amazon Bedrock의 생성 속도는 초당 1,315.0자입니다. Polly Standard 제공자 보기

현재 대표 API 엔드포인트 비교에서 가장 저렴한 텍스트 음성 변환 모델은 Kokoro 82M v1.0이며, Replicate의 가격은 100만 자당 US$0.65입니다. Kokoro 82M v1.0 제공자 보기

현재 비교에서 품질 대비 가격 경쟁력이 가장 높은 대표 엔드포인트로는 Cartesia 제공 Sonic 3.6, Inworld 제공 Realtime TTS-2 및 SpeechifyAI 제공 Simba 3.2 등이 있습니다. 이러한 엔드포인트는 현재 품질 대비 가격 프론티어에 위치하며, 동시에 더 저렴하고 품질도 높은 대안은 거의 없습니다. Sonic 3.6 제공자 보기