Metodología de benchmarking de texto a voz
Alcance y contexto
Artificial Analysis realiza benchmarking de modelos de texto a voz, principalmente de los que se entregan mediante endpoints de API serverless. Esta página describe nuestra metodología de benchmarking de texto a voz, incluida nuestra evaluación de calidad y rendimiento. Las métricas de velocidad y precio requieren un endpoint serverless. Los modelos que no cuentan con uno pueden incluirse igualmente en las Arenas solo para la comparación de calidad.
Tanto en nuestro benchmarking de rendimiento como en las Arenas, nos enfocamos en reflejar la experiencia de los usuarios finales de las APIs serverless. Usamos la implementación estándar de las APIs de proveedores según lo sugerido por la documentación de cada proveedor.
Métricas clave
Usamos las siguientes métricas para realizar el seguimiento de la calidad, el rendimiento y el precio en modelos de texto a voz.
Elo de calidad
Puntaje Elo relativo de los modelos, determinado por respuestas de usuarios en la Arena de texto a voz de Artificial Analysis. Las clasificaciones se calculan a partir de votos por pares con un modelo Bradley-Terry ajustado por máxima verosimilitud. Los puntajes se anclan fijando un modelo por arena en 1000, y los demás se reportan en relación con él en la escala Elo estándar. Consulta Cómo funciona la arena más abajo para más detalle sobre cómo se presentan y se votan las comparaciones.
El muestreo de enfrentamientos favorece a los modelos que necesitan comparaciones, como los incorporados recientemente y los que todavía no tienen puntuación, de modo que los modelos nuevos acumulan comparaciones rápidamente. Un tope limita la proporción de comparaciones de un modelo que puede corresponder a un mismo rival y, al estimar, los duelos de pares que se repiten con frecuencia reciben menos peso, de modo que ningún enfrentamiento domine el puntaje de un modelo. En nuestros experimentos, las clasificaciones de ambas arenas, la de voces de proveedores y la de voces controladas, no fueron sensibles a la intensidad de esta ponderación.
Cada tabla se ajusta de forma independiente: la puntuación general usa todos los votos elegibles, mientras que las tablas por categoría, acento e idioma son ajustes separados sobre sus propios subconjuntos y no agregaciones del resultado general. Todos los votos elegibles del historial de una tabla cuentan por igual, sin ponderación temporal ni decaimiento por antigüedad. Los puntajes se recalculan varias veces al día a partir del historial completo de votos y se revisan antes de publicarse. Mostramos intervalos de confianza del 95 % y rangos de posición, y los modelos se ordenan por Elo sin redondear. Es posible que algunos modelos no se muestren por no tener aún suficientes votos.
Pronunciation Robustness
El benchmark Pronunciation Robustness mide si los modelos de Text to Speech pronuncian correctamente texto difícil. Complementa los resultados de preferencia de la Arena puntuando cada modelo en la pronunciación de un conjunto fijo de oraciones de desafío, evaluadas por revisores humanos según lecturas aceptadas.
Cada modelo lee el conjunto idéntico con una única voz fija en inglés estadounidense. Cada oración contiene uno o más fragmentos resaltados con pronunciaciones aceptadas, incluidas las variantes válidas en inglés de EE. UU. y del Reino Unido. Los clips se presentan a los revisores en orden aleatorio y sin nombres de modelos. Los prompts se envían a cada modelo tal como están escritos, sin normalización por nuestra parte. Si un modelo ofrece una opción de normalización de texto, usamos su valor predeterminado.
El conjunto cubre cuatro categorías de desafíos de pronunciación:
- Contextually Appropriate (Contextual Disambiguation): palabras escritas igual pero leídas de forma distinta según el contexto, p. ej. a wound that is bandaged vs. a bandage that is wound.
- Expanding Shorthand (Text Normalization): números, fechas, unidades y notación leídos con naturalidad, p. ej. 6'2", Chapter XVII o 1 tsp of sugar.
- Preserving Exact Sequences (Sequence Fidelity): códigos, rutas, correos e identificadores pronunciados con exactitud, p. ej. .env.local o a.chen@ucsf.edu.
- Standalone Terms (Term Pronunciation): nombres de marcas, lugares y términos técnicos pronunciados correctamente, p. ej. Arkansas, façade o genre.
Tres o más revisores independientes evalúan más del 95 % de los clips de cada modelo publicado. Para cada fragmento resaltado responden con Sí, No o No pude distinguirlo si se pronunció de forma natural y correcta. La puntuación de un modelo es la proporción de juicios respondidos Sí sobre Sí más No. Las respuestas "No pude distinguirlo" se excluyen del denominador. Las puntuaciones por categoría usan la misma fórmula sobre los fragmentos de esa categoría. Las barras de error muestran intervalos de confianza del 95 %, calculados con errores estándar agrupados por fragmento porque cada fragmento lo evalúan varios revisores.
Publicamos los resultados de un modelo cuando al menos el 95 % de las muestras del conjunto están cubiertas por tres o más revisores aprobados.
Consulta la visión general de Pronunciation Robustness para un ejemplo de la tarjeta de evaluación que ven los revisores y clips de ejemplo de cada modelo del benchmark.
Precio por 1M de caracteres
Todos los modelos TTS se reportan como precio por 1M de caracteres de texto de entrada. Cuando los proveedores no cobran directamente por carácter, derivamos un equivalente:
- Por carácter: se usa directamente la tarifa listada
- Planes de suscripción: tarifa efectiva del plan de menor costo, anual cuando esté disponible, que incluya al menos 1M de caracteres, asumiendo 80% de utilización
- Basado en tokens: derivado usando precios por lote, convirtiendo caracteres a tokens de entrada y estimando la duración de la salida de audio
- Duración de salida: convertida usando una velocidad de habla asumida de 150 palabras por minuto, aproximadamente 825 caracteres por minuto
- Por byte: 1 byte UTF-8 equivale aproximadamente a 1 carácter para texto en inglés
- Tiempo de inferencia: estimado a partir de ejecuciones de benchmark usando ~25 textos de ~500 caracteres
- Modelos con pesos abiertos: listados sin precio, salvo que el modelo también se ofrezca mediante una API de pago, en cuyo caso se usa esa tarifa
- Modelos S2S: derivado del costo de generar habla para 20 prompts fijos de la Arena TTS con entrada de texto y salida solo de audio. Incluimos la entrada de texto reportada, audio de salida, texto de salida y tokens de razonamiento/pensamiento expuestos por separado. Los tokens de texto de salida se incluyen cuando se reportan como parte de la respuesta de audio. Se ignoran los descuentos por tokens cacheados.
Rendimiento
Mediana de caracteres de texto de entrada que el proveedor convierte en habla por segundo, calculada sobre los últimos 3 días de mediciones. Para cada generación dividimos el número de caracteres del prompt por el tiempo que toma generar y recibir el clip.
La medición incluye la descarga del clip de audio desde el proveedor cuando se entrega una URL en lugar de una respuesta de audio. Así reflejamos cómo los usuarios finales reciben realmente un clip generado, ya que las URLs pueden generarse antes de que el audio esté completo. Los clips de audio se generan con un tamaño de lote de 1 cuando corresponde.
El benchmarking se realiza 4 veces al día. Para cada evaluación de benchmarking seleccionamos una sola voz aleatoria por modelo. Se usa un prompt único de ~500 caracteres para cada generación.
Cómo funciona la arena
Cada comparación presenta dos clips de audio generados a partir del mismo prompt de texto. En la Arena de voces de proveedores, ambos clips usan voces de la misma categoría de género y acento; en la Arena de voces controladas, ambos usan la misma voz de referencia clonada. Los nombres de los modelos se ocultan hasta después de votar, el orden de presentación es aleatorio y quien escucha debe reproducir una parte mínima de cada clip antes de que se habilite el voto. El voto es una elección binaria, sin opción de empate. Los prompts abarcan cuatro categorías (atención al cliente, entretenimiento, divulgación de conocimiento y asistentes) e incluyen material exigente, como cadenas alfanuméricas y secuencias numéricas; el conjunto de prompts se renueva con el tiempo.
Las muestras de audio se generan una sola vez por modelo y se estandarizan antes de entrar en la arena, de modo que los votos de un modelo se emiten sobre un conjunto consistente de muestras que puede revisarse y normalizarse antes de publicarse. Los clips se convierten a un formato de reproducción uniforme y se normalizan a un mismo objetivo de sonoridad, para que las diferencias de volumen o codificación entre proveedores no influyan en los votos.
Arena de voces controladas
La Arena de voces controladas usa clonación de voz para estandarizar las voces usadas para evaluar cada modelo de texto a voz. Al comparar modelos usando las mismas voces de referencia, separa la preferencia del oyente por una voz particular de aspectos más amplios de la calidad del modelo, como la naturalidad del habla, la calidad del audio, la pronunciación, el ritmo y la prosodia. Esto permite una comparación más equivalente de los modelos de texto a voz subyacentes.
Para la Arena de voces controladas, el conjunto de referencia en inglés consta de 8 voces grabadas profesionalmente: 2 femeninas de EE. UU., 2 masculinas de EE. UU., 2 femeninas de Reino Unido y 2 masculinas de Reino Unido. Cuando un modelo acepta la grabación de referencia completa, incluidos los modelos que la recortan de forma nativa, proporcionamos la grabación completa. Cuando un modelo limita la duración del audio de referencia, proporcionamos una versión más corta, normalmente de 5 a 10 o de 10 a 15 segundos, cortada en una pausa natural.
Más allá del inglés, la Arena de voces controladas también evalúa modelos en español, francés, alemán, portugués, japonés, hindi, chino mandarín, árabe y vietnamita. Para cada idioma distinto del inglés, el conjunto de referencia incluye una voz masculina y una voz femenina grabadas profesionalmente, ambas por hablantes nativos. La clonación de voz también se usa para estandarizar las voces dentro de cada idioma, mientras que los votos de preferencia se recogen de evaluadores seleccionados para garantizar que el idioma evaluado sea su lengua materna. Cada modelo se evalúa solo en los idiomas que admite, y se publica una clasificación específica por idioma cuando los modelos han acumulado suficientes comparaciones para producir puntuaciones Elo estables.
La Arena de voces controladas complementa nuestra Arena de voces de proveedores, donde cada modelo se evalúa usando un conjunto representativo de sus propias voces disponibles públicamente.
Selecciona una voz controlada abajo para escuchar su grabación de referencia.
Arena de voces de proveedores
La Arena de voces de proveedores evalúa cada modelo de texto a voz con un conjunto representativo de las voces que pone a disposición el proveedor de ese modelo. Complementa la Arena de voces controladas, donde los modelos se comparan usando las mismas voces de referencia clonadas. Las voces de proveedores reflejan cómo los usuarios suelen experimentar cada modelo a través de su propia API pública, interfaz de producto o documentación.
Para cada modelo seleccionamos varias voces ofrecidas por el proveedor para que la comparación sea representativa y justa. Seleccionamos 2 voces por cada combinación de masculino y femenino con acentos de EE. UU. y del Reino Unido, para un total de 8 voces. Cuando una combinación de género y acento no está disponible, excluimos esa combinación de la evaluación en la Arena de voces de proveedores.
Las voces se seleccionan según su prominencia en las interfaces y la documentación de los proveedores, y se excluyen las voces que no son neutras (por ejemplo, acentos regionales muy estilizados). Los creadores de modelos también pueden pedirnos que usemos voces específicas cuando hay muchas disponibles. Cuando no se proporcionan voces del proveedor, como suele ocurrir con los modelos open source, usamos clips de voz de actores de voz profesionales como archivos fuente para generar habla (consulta la Arena de voces controladas más arriba para ver muestras).
Selecciona un creador de modelos abajo para ver las voces de proveedor que se usan actualmente para cada uno de sus modelos.
Calidad de quienes votan
La mayoría de las valoraciones que publicamos provienen de un panel remunerado con buen historial en proyectos comparables, y abarcan tanto los votos de preferencia en las arenas como las revisiones de Pronunciation Robustness. Para las arenas en inglés y para Pronunciation Robustness, se seleccionan hablantes nativos de inglés residentes en Estados Unidos o el Reino Unido. Para cada idioma distinto del inglés en la Arena de voces controladas, la selección se hace por primera lengua y, cuando es posible, con evaluadores que residen en su país de origen, de modo que quienes evalúan son hablantes nativos del idioma que evalúan.
Las sesiones de Pronunciation Robustness incluyen clips de control de atención con respuestas conocidas, y los revisores que fallan cualquier control respondido quedan excluidos por completo. Los votos de las arenas pasan un filtrado de calidad automatizado antes de entrar en la clasificación. Quienes evalúan de forma remunerada nunca ven los nombres de los modelos. Comparamos de forma continua las clasificaciones del grupo remunerado y del público como verificación de consistencia.
Criterios de inclusión de modelos y proveedores
Nuestro objetivo es analizar y comparar modelos y proveedores de texto a voz populares y de alto rendimiento para ayudar a los usuarios finales a elegir cuál usar. Por eso aplicamos una prueba de relevancia en la industria y rendimiento competitivo para evaluar la inclusión de nuevos modelos y proveedores. Estamos refinando estos criterios y aceptamos con gusto comentarios y sugerencias. Para sugerir modelos o proveedores, contáctanos mediante la página de contacto. Cuando un proveedor publica una actualización importante de un modelo, la listamos como una nueva variante fechada, regeneramos todas sus muestras de arena y la clasificamos sin heredar votos. Las variantes anteriores siguen listadas mientras sean elegibles.
Declaración de independencia
El benchmarking se realiza con estricta independencia y objetividad. No recibimos compensación de ningún proveedor por aparecer listado ni por resultados favorables en Artificial Analysis.