Metodología de benchmarking de texto a voz

Alcance y contexto

Artificial Analysis realiza benchmarking de modelos de texto a voz entregados mediante endpoints de API serverless. Esta página describe nuestra metodología de benchmarking de texto a voz, incluida nuestra evaluación de calidad y rendimiento. Consideramos que los endpoints de texto a voz son serverless cuando los clientes solo pagan por uso, no una tarifa fija de acceso.

Tanto en nuestro benchmarking de rendimiento como dentro de la Arena de texto a voz, nos enfocamos en reflejar la experiencia del usuario final que usa APIs serverless. Nos enfocamos en medir el tiempo hasta recibir el archivo de audio localmente. Cuando la respuesta de la API es una URL en lugar de bytes, incluimos el tiempo de descarga del archivo en nuestra medición de tiempo de respuesta. Nuestro enfoque es usar la implementación estándar de las APIs de proveedores según lo sugerido por la documentación de cada proveedor. Cuando la API del proveedor ofrece la opción, estandarizamos la frecuencia de muestreo del audio a 22.05 kHz.

Métricas clave

Usamos las siguientes métricas para realizar el seguimiento de la calidad, el rendimiento y el precio en modelos de texto a voz.

Elo de calidad

Puntaje Elo relativo de los modelos, determinado por respuestas de usuarios en la Arena de texto a voz de Artificial Analysis.

Es posible que algunos modelos no se muestren por no tener aún suficientes votos. Usamos un modelo de regresión lineal similar a cómo LMSYS calcula los puntajes Elo para Chatbot Arena.

Precio por 1M de caracteres

Todos los modelos TTS se reportan como precio por 1M de caracteres de texto de entrada. Cuando los proveedores no cobran directamente por carácter, derivamos un equivalente:

  • Por carácter: se usa directamente la tarifa listada
  • Planes de suscripción: tarifa efectiva del plan de menor costo, anual cuando esté disponible, que incluya al menos 1M de caracteres, asumiendo 80% de utilización
  • Basado en tokens: derivado usando precios por lote, convirtiendo caracteres a tokens de entrada y estimando la duración de la salida de audio
  • Duración de salida: convertida usando una velocidad de habla asumida de 150 palabras por minuto, aproximadamente 825 caracteres por minuto
  • Por byte: 1 byte UTF-8 equivale aproximadamente a 1 carácter para texto en inglés
  • Tiempo de inferencia: estimado a partir de ejecuciones de benchmark usando ~25 textos de ~500 caracteres
  • Modelos con pesos abiertos: sin precios de API comercial; listado sin precio
  • Modelos S2S: derivado del costo de generar habla para 20 prompts fijos de la Arena TTS con entrada de texto y salida solo de audio. Incluimos la entrada de texto reportada, audio de salida, texto de salida y tokens de razonamiento/pensamiento expuestos por separado. Los tokens de texto de salida se incluyen cuando se reportan como parte de la respuesta de audio. Se ignoran los descuentos por tokens cacheados.

Al reportar precios, no incluimos descuentos temporales.

Tiempo de generación

Mediana del tiempo que tarda el proveedor en generar un solo clip de audio con ~500 caracteres de entrada, calculada sobre los últimos 14 días de mediciones.

El tiempo de generación incluye descargar el clip de audio del proveedor cuando se proporciona una URL en lugar de una respuesta de audio. Esto refleja la latencia del usuario final al recibir un clip de audio generado, ya que las URLs pueden generarse antes de que se complete el audio. Los clips de audio se generan con un tamaño de lote de 1 cuando corresponde.

El benchmarking se realiza 4 veces al día en horarios aleatorios. Para cada evaluación de benchmarking seleccionamos una sola voz aleatoria por modelo. Se usa un prompt único de ~500 caracteres para cada generación.

Voces controladas

La Arena de voces controladas usa clonación de voz para estandarizar las voces usadas para evaluar cada modelo de texto a voz. Al comparar modelos usando las mismas voces de referencia, separa la preferencia del oyente por una voz particular de aspectos más amplios de la calidad del modelo, como la naturalidad del habla, la calidad del audio, la pronunciación, el ritmo y la prosodia. Esto permite una comparación más equivalente de los modelos de texto a voz subyacentes.

La Arena de voces controladas complementa nuestra Arena de voces de proveedores, donde cada modelo se evalúa usando un conjunto representativo de sus propias voces disponibles públicamente. El conjunto de referencia consiste en 8 voces grabadas profesionalmente: 2 femeninas de EE. UU., 2 masculinas de EE. UU., 2 femeninas de Reino Unido y 2 masculinas de Reino Unido. Selecciona una voz controlada abajo para escuchar su grabación de referencia.

Voces de modelos

Para cada modelo probado, evaluamos varias voces para garantizar que nuestra comparación entre modelos sea representativa y justa. Características de voz como acento, género y estilo suelen ser aspectos de las voces para las que cada modelo puede generar habla, no del modelo subyacente. Para cada modelo seleccionamos 2 voces de cada combinación de masculino y femenino, y acentos de EE. UU. y Reino Unido (8 combinaciones en total). Cuando una combinación de género y acento no está disponible, excluimos esa combinación de la evaluación en la Arena de texto a voz.

Cuando no se proporcionan voces, como suele ocurrir con modelos open source, usamos clips de voz de actores de voz profesionales como archivos fuente para generar habla. Todos los clips de voz cuentan con licencia para uso comercial.

Selecciona un creador de modelos abajo para ver las voces que se usan actualmente en la Arena de texto a voz para cada uno de sus modelos.

Criterios de inclusión de modelos y proveedores

Nuestro objetivo es analizar y comparar modelos y proveedores de texto a voz populares y de alto rendimiento para ayudar a los usuarios finales a elegir cuál usar. Por eso aplicamos una prueba de relevancia en la industria y rendimiento competitivo para evaluar la inclusión de nuevos modelos y proveedores. Estamos refinando estos criterios y aceptamos con gusto comentarios y sugerencias. Para sugerir modelos o proveedores, contáctanos mediante la página de contacto.

El benchmarking se realiza 4 veces al día en horarios aleatorios. Para cada evaluación de benchmarking seleccionamos una sola voz aleatoria por modelo. Se usa un prompt único de ~500 caracteres para cada generación.

Declaración de independencia

El benchmarking se realiza con estricta independencia y objetividad. No recibimos compensación de ningún proveedor por aparecer listado ni por resultados favorables en Artificial Analysis.