Metodologia de benchmarking de geração de vídeo
Escopo e contexto
A Artificial Analysis realiza o benchmarking de modelos de geração de vídeo, normalmente disponibilizados por endpoints de API serverless. Esta página descreve a metodologia usada para medir a qualidade, a velocidade e o preço dos modelos de geração de vídeo.
Para os recursos de geração de vídeo, publicamos seis benchmarks:
- AA-Video-T2V-Silent v2.0: modelos que geram vídeo usando apenas um prompt de texto.
- AA-Video-I2V-Silent v1.0: modelos que geram vídeo usando uma imagem de referência como primeiro quadro e, quando permitido, um prompt de texto complementar.
- AA-Video-Editing-Silent v1.0: modelos que geram vídeo a partir de um vídeo de entrada e um prompt de texto.
- AA-Video-T2V v2.0: modelos de texto para vídeo que geram áudio sincronizado junto com o vídeo.
- AA-Video-I2V v1.0: modelos de imagem para vídeo que geram áudio sincronizado junto com o vídeo.
- AA-Video-Editing v1.0: modelos de edição de vídeo que geram áudio sincronizado junto com o vídeo.
Cada benchmark tem seu próprio grupo de classificação Elo no Video Arena. Assim, os resultados sem áudio e com áudio não são comparados diretamente, e a edição não é comparada com a geração.
Aplicamos um conjunto padrão de configurações a todos os vídeos que geramos, em todos os modelos e provedores. Usamos vídeos gerados com configurações idênticas para cada modelo, incluindo resolução, taxa de quadros, duração, proporção, seed, guidance e etapas de inferência, para garantir a comparabilidade. A lista completa está na seção Configurações padrão de geração abaixo.
Cobertura de endpoints
Cargas de trabalho cobertas: o benchmarking de inferência abrange endpoints de geração de texto para vídeo e imagem para vídeo.
Somente endpoints serverless públicos: o benchmarking abrange endpoints realmente serverless que estão ou estarão disponíveis ao público. Produtos de demonstração, apresentações de hardware e implantações dedicadas ou privadas estão fora do escopo.
Endpoints padrão e modificados
Classificamos cada endpoint como Padrão — oferece o modelo nativo com fidelidade total e disponibiliza seus parâmetros de entrada padrão — ou Modificado — foi alterado em relação ao modelo nativo de formas que afetam a fidelidade da saída, normalmente para aumentar a velocidade de geração ou reduzir o custo.
Os endpoints modificados recebem o rótulo Modificado na Artificial Analysis e podem ser ocultados da visualização padrão do ranking, mas continuam visíveis para quem optar por exibi-los. Para preservar a imparcialidade de nossos benchmarks padrão, reservamo-nos o direito de decidir se um endpoint deve ser classificado como Modificado — os indicadores incluem destilação, exposição parcial dos parâmetros de entrada do modelo nativo ou perda significativa de qualidade na saída — e quantas variantes de um mesmo modelo serão listadas.
Principais métricas
Usamos as métricas a seguir para acompanhar a qualidade, o desempenho e o preço dos modelos de geração de vídeo.
Elo de qualidade
A pontuação Elo de cada modelo reflete sua qualidade relativa, derivada de votos cegos do nosso painel recrutado, junto com os votos públicos dados no Video Arena da Artificial Analysis antes de 1º de janeiro de 2026. Nos dois casos, quem vota compara dois vídeos gerados por modelos diferentes a partir do mesmo prompt e escolhe o que prefere. Os votos públicos anteriores a essa data existem apenas em texto para vídeo e imagem para vídeo, e agora contam apenas para imagem para vídeo: os benchmarks de texto para vídeo foram reiniciados na v2.0 (veja AA-Video-T2V v2.0 & AA-Video-T2V-Silent v2.0 abaixo). A edição de vídeo e as três modalidades com áudio receberam o primeiro voto público depois disso, então suas pontuações vêm apenas dos votos do painel. Agregamos esses votos pareados usando a estimativa de máxima verossimilhança de Bradley-Terry e os redimensionamos para uma faixa semelhante à do Elo, facilitando a leitura. As classificações são recalculadas a cada hora.
O Elo é informado separadamente para cada benchmark (AA-Video-T2V-Silent v2.0, AA-Video-I2V-Silent v1.0, AA-Video-Editing-Silent v1.0, AA-Video-T2V v2.0, AA-Video-I2V v1.0 e AA-Video-Editing v1.0), pois as disputas na arena combinam apenas resultados da mesma modalidade.
Leaderboards
Publicamos um leaderboard global para cada benchmark. O AA-Video-T2V v2.0 e o AA-Video-T2V-Silent v2.0 também publicam leaderboards por categoria (veja abaixo).
- Leaderboard global: o ranking publicado neste site, que agrega todos os votos retidos pelas regras acima. Um modelo aparece assim que recebe um número mínimo de votos.
Preço por minuto de vídeo
Preço do provedor (USD) para gerar um minuto de vídeo com as configurações padrão de geração.
O preço é obtido diretamente da tarifa por minuto publicada por cada provedor.
Tempo de geração
Tempo mediano que o provedor leva para gerar um único vídeo com as configurações padrão de geração, calculado ao longo dos últimos 3 dias.
O tempo de geração é medido de ponta a ponta: do envio da solicitação ao provedor, passando pelo tempo de fila, pela inferência e pela codificação do vídeo, até o download do vídeo concluído. Para APIs assíncronas (enviar → consultar → baixar), isso inclui as três etapas.
Para modelos de imagem para vídeo, o tempo de geração também inclui o tempo necessário para enviar a imagem de referência ao provedor. Para provedores que aceitam uma URL da imagem de referência, não há etapa de upload e o tempo de geração não inclui o envio da imagem.
Configurações padrão de geração
Estas configurações se aplicam aos benchmarks de texto para vídeo e imagem para vídeo, salvo indicação em contrário.
| Configuração | Valor |
|---|---|
| Resolução | 1080p (ou o valor compatível mais próximo) |
| Taxa de quadros | 24 FPS (ou o valor compatível mais próximo) |
| Duração | 10 segundos (ou o número equivalente de quadros quando a duração precisar ser especificada em quadros) |
| Proporção | 16:9 horizontal |
| Seed | 42 (quando o modelo disponibiliza um parâmetro de seed) |
| Aprimoramento do prompt | Ativado quando recomendado pelo criador do modelo; caso contrário, desativado |
| CFG / guidance | Valor padrão da API do próprio desenvolvedor ou do repositório de código aberto |
| Etapas de inferência | Valor padrão da API do próprio desenvolvedor ou do repositório de código aberto |
Quando um provedor não oferece o padrão exato, usamos o valor compatível mais próximo, com desempate para cima (por exemplo, quando 24 FPS não está disponível, preferimos 30 FPS a 18 FPS, pois ambos estão à mesma distância do padrão). O AA-Video-T2V v2.0 e o AA-Video-I2V v1.0 avaliam modelos com a saída de áudio ativada; todos os demais padrões continuam válidos.
Texto para vídeo
Os modelos de texto para vídeo recebem um prompt de texto como única entrada. Os prompts vêm de um conjunto selecionado e reproduzível.
Imagem para vídeo
Os modelos de imagem para vídeo recebem uma imagem de referência e, quando permitido, um prompt de texto complementar. As imagens de referência usadas em nossos benchmarks seguem estes padrões:
- Formato: PNG (sem perda). Não usamos JPG/JPEG para evitar os artefatos de compressão que a codificação com perda pode introduzir.
- Resolução: 1920×1080 (16:9, correspondente à resolução de destino do vídeo).
- Envio direto de bytes: Quando um provedor não aceita URLs ou exige determinado tamanho ou formato, baixamos a imagem, aplicamos as transformações necessárias e enviamos os bytes diretamente.
- Tempo de upload: Quando um provedor exige que a imagem seja enviada à sua plataforma antes da geração, esse tempo de upload é contabilizado no tempo de geração.
AA-Video-T2V v2.0 & AA-Video-T2V-Silent v2.0
Visão geral da metodologia
Modelos de texto para vídeo variam em capacidade entre casos de uso. Um modelo pode liderar em atuação humana e sincronia labial, outro em animação, texto na tela ou movimento de UI. O modelo que um estúdio escolhe para um filme de marca não é necessariamente o que uma equipe de produto escolhe para demonstrações de movimento de UI, nem o que um criador escolhe para clipes para redes sociais.
Nossa metodologia mede essa variação diretamente. Classificamos modelos por preferência humana sobre uma taxonomia de casos de uso reais e capacidades de modelo, identificando o melhor modelo no geral e o melhor modelo para um trabalho específico. Renovamos nosso conjunto de prompts regularmente para que o leaderboard continue medindo a fronteira à medida que ela avança.
O AA-Video-T2V v2.0 avalia texto para vídeo com áudio. O AA-Video-T2V-Silent v2.0 avalia texto para vídeo sem áudio.
Curadoria e renovação de prompts
Mantemos um conjunto curado de prompts, renovado regularmente para acompanhar a fronteira à medida que as capacidades dos modelos evoluem.
- Taxonomia de prompts: cada prompt é escrito segundo dois eixos, caso de uso real e capacidade do modelo, e etiquetado para ambos. Cada prompt também é etiquetado com seu estilo visual. Os prompts são amostrados uniformemente por caso de uso e capacidade na nossa arena.
- Conjuntos de prompts: o AA-Video-T2V v2.0 usa 1.000 prompts. O AA-Video-T2V-Silent v2.0 usa 500 prompts.
- Atualidade: renovamos nosso conjunto de prompts regularmente. Prompts são aposentados quando deixam de separar os modelos ou de refletir como as pessoas fazem prompts em modelos de vídeo hoje.
Taxonomia de prompts
Construímos nossa taxonomia de prompts ao longo de dois eixos e etiquetamos o estilo visual separadamente.
Caso de uso. Estes casos de uso se baseiam na nossa análise de como consumidores e empresas estão adotando a geração de texto para vídeo, e na nossa observação de casos de uso emergentes. Exemplos de tarefas para cada caso de uso:
- Marketing & Advertising: pôsteres animados, vinhetas de logotipo, filmes de marca, peças de destaque de produto, vídeos de lançamento
- Retail & E-commerce: fotos de produto em estúdio, demonstrações de produto, movimento de vestuário e moda, depoimentos no estilo de criadores, provas de looks
- Live-Action Film: planos cinematográficos, episódios de microdrama, pré-visualização
- Animation & Gaming: cenas animadas, trailers de jogos, pré-visualização para animação e jogos
- Architecture & Real Estate: sobrevoos externos, percursos internos, staging virtual
- Productivity & Knowledge Work: vídeos explicativos, vídeos educacionais e de treinamento, visualizações de dados animadas, simulações de cenários
- UI/UX & Motion Design: tipografia cinética, demonstrações de movimento de UI em diferentes dispositivos, motion graphics abstratos
- Consumer: selfies, momentos pessoais, imagens de banco e b-roll do dia a dia
- Social Media & Creator Content: talking heads, clipes de podcast, vídeos de ASMR e satisfatórios, dança, vlogs, formatos em alta
- Frontier: capacidades na fronteira atual e além dela
Capacidade. Estas capacidades de modelo são informadas pelo nosso trabalho contínuo com os principais laboratórios e pelas capacidades que eles perseguem, e fundamentadas em benchmarks acadêmicos. Exemplos de cada capacidade:
- Physics: mecânica, efeitos térmicos, interações entre materiais, fratura e deformação, óptica, causa e efeito, física contrafactual
- Complex Composition: associação de atributos, relações espaciais, interação entre múltiplos objetos, contagem, ordenação temporal
- Human Anatomy: marcha e locomoção, movimentos motores finos, expressão facial, movimentos acrobáticos, preensão de objetos, interação humana
- Lighting & Materials: iluminação, exposição, sombras, temperatura de cor, textura, tecido, cabelo e pelos
- Multi-Scene & Narrative: histórias com múltiplos eventos, transições entre planos, montagem, consistência de identidade entre planos
- Camera Control: tipos de plano como close-up, aéreo, POV e ângulo baixo, e movimentos como tracking, dolly, órbita, grua, crash zoom, whip pan e rack focus
- Text Rendering: textos curtos e longos, layout 2D, sequências não lexicais, texto em superfícies que se deformam
- Spatio-Temporal Consistency: coerência espacial, time-lapses, oclusão e reentrada, histórias em plano único
- Audio Synchronization: efeitos sonoros diegéticos, música de fundo e trilha sonora, som dentro e fora de quadro
- Dialogue & Lip Sync: diálogo com um ou vários falantes, narração em off versus fala em cena
Estilo. Cada prompt também é etiquetado com um de oito estilos visuais: Photorealistic, 3D Render/CGI, Cartoon and Anime, Flat Design, Hand-drawn/Illustration, Stop-Motion/Claymation, Lo-Fi e Mixed Styles. Os estilos não são amostrados uniformemente, e a maioria dos prompts é fotorrealista.
Redação de prompts
Escrevemos os prompts para diferenciar os modelos de vídeo de fronteira, que lidam bem com pedidos simples. Os prompts são escritos:
- Para cobertura completa da taxonomia, distribuídos uniformemente por cada combinação de caso de uso e capacidade, com um piso alto de complexidade em cada capacidade, como movimentos amplos em vez de sutis e vários sujeitos interagindo.
- Para refletir trabalho real de produção, com base nos guias de prompting dos desenvolvedores de modelos, nos nossos conjuntos de prompts existentes e nos fluxos de trabalho que observamos no setor.
- Pensando no som para o AA-Video-T2V v2.0: os prompts especificam diálogo, efeitos sonoros, ambiência e música quando a cena pede.
Uma pessoa revisa cada prompt antes de o servirmos na arena.
Aposentadoria de prompts
Aposentamos prompts quando os votos da arena mostram que eles deixaram de separar os modelos ou quando deixaram de refletir como as pessoas fazem prompts em modelos de vídeo.
Metodologia de amostragem
Para cada confronto, amostramos uniformemente entre as combinações de caso de uso e capacidade e, em seguida, sorteamos um prompt aleatoriamente dentro da combinação escolhida.
Cada confronto emparelha dois vídeos gerados do mesmo prompt, dentro do mesmo benchmark, de modo que vídeos com áudio nunca são emparelhados com vídeos sem som. A posição esquerda/direita é aleatorizada.
Padrões de reprodução
Exibimos todos os vídeos aos avaliadores sob os mesmos padrões:
- Resolução: até 1080p, conforme gerado. Os vídeos nunca são ampliados: modelos que não geram 1080p são exibidos na maior resolução compatível, e saídas acima de 1080p são reduzidas para 1080p.
- Codificação: H.264 em alta qualidade, com picos de bitrate limitados a 10 Mbps.
- Duração: 10 segundos em 16:9. Modelos que não geram 10 segundos são exibidos com sua duração máxima.
- Nivelamento de áudio: no AA-Video-T2V v2.0, nivelamos o loudness de cada vídeo em direção a -18 LUFS com um único ganho fixo. A mixagem de um modelo nunca é comprimida nem remasterizada, e nenhum modelo vence por soar mais alto.
Cálculo do Elo
Coleta de votos
A qualidade do modelo é medida por preferência humana.
- Votação cega em pares: avaliadores assistem a dois vídeos gerados do mesmo prompt por dois modelos diferentes, sem identidades de modelo, e escolhem o que preferem. Os dois vídeos são reproduzidos em tamanho completo em um único player, e os avaliadores alternam entre eles.
- Dicas de julgamento: cada confronto mostra dicas curtas ligadas ao caso de uso, à capacidade principal e ao estilo do prompt, direcionando a atenção aos aspectos específicos sob teste.
- Tempo mínimo: votos só podem ser dados depois que cada vídeo for reproduzido por pelo menos 8 segundos. No AA-Video-T2V v2.0, os avaliadores são orientados a julgar também o som, usando fones de ouvido.
- Qualidade do voto: os dois leaderboards são classificados apenas com votos do nosso painel recrutado, triado e verificado pelo provedor do painel. Cerca de um em cada cinco confrontos em cada sessão é uma verificação de qualidade com uma resposta de forte consenso. Sessões que falham nessas verificações são rejeitadas e todos os seus votos são removidos, e os votos de verificação de qualidade não entram no rating.
Filtragem de votos
O AA-Video-T2V v2.0 e o AA-Video-T2V-Silent v2.0 são novos leaderboards. Aposentamos todos os votos de texto para vídeo dados antes da renovação, para todos os modelos, porque esses votos foram coletados com prompts e padrões de reprodução anteriores. Os votos públicos do Video Arena não contam para esses ratings. Calculamos o Elo do zero sobre os votos retidos, ancorado em Kling 3.0 1080p (Pro) = 1000 para o leaderboard geral e para todos os leaderboards de subcategoria.
Leaderboards
Para cada benchmark, publicamos:
- Leaderboard geral: o ranking sobre todos os votos retidos. Um modelo aparece assim que recebe um número mínimo de votos.
- Leaderboards por categoria: o mesmo cálculo restrito aos prompts etiquetados com um determinado caso de uso, capacidade ou estilo, publicado assim que a categoria tem votos suficientes.
Metodologia de teste do tempo de geração
Principais detalhes técnicos:
- Frequência: O teste de texto para vídeo é executado a cada 2 horas, em um horário aleatório dentro de cada janela.
- Tamanho da amostra: o tempo de geração em destaque é a mediana das medições bem-sucedidas nos últimos 3 dias. Com medições a cada 2 horas, o teste de texto para vídeo costuma acumular cerca de 36 amostras por provedor em cada período.
- Seleção do prompt: cada execução seleciona um único prompt aleatório em um conjunto selecionado do banco de dados e o envia a todos os modelos hospedados ativos.
- Seed: uma seed fixa de 42 é usada quando o modelo disponibiliza esse parâmetro, permitindo reproduzir os resultados entre as execuções.
- Medição de ponta a ponta: o tempo de geração é medido de ponta a ponta, desde a primeira chamada à API até o download do vídeo concluído. Para provedores com APIs assíncronas (enviar, consultar, baixar), inclui espera na fila, inferência e download.
- Modo da API: consultamos o status da tarefa a cada 100 milissegundos para que a espera medida na fila reflita o tempo real do provedor, não a granularidade das consultas.
- Escopo: atualmente, o tempo de geração é medido apenas para modelos sem áudio de texto para vídeo e imagem para vídeo. O AA-Video-Editing-Silent v1.0 e os três benchmarks com áudio (AA-Video-T2V v2.0, AA-Video-I2V v1.0 e AA-Video-Editing v1.0) são classificados pelo Video Arena (Elo de qualidade), mas não passam atualmente por benchmarking de latência.
- Agregação: a mediana, p05, p25, p75 e p95 são calculadas a partir da distribuição bruta das medições bem-sucedidas, sem remover valores atípicos.
- O que não é medido: atraso de inicialização a frio do provedor, negociações de autenticação, sobrecarga de novas tentativas e qualquer aquecimento do cliente. Cada entrada no conjunto de dados é uma única medição isolada.
- Infraestrutura: as execuções ocorrem no Google Cloud Run em us-central1.
- Novos endpoints: para endpoints recém-adicionados, inclusive os avaliados antes da disponibilidade pública, podemos ajustar a frequência do benchmarking para formar uma distribuição dos tempos de geração antes de listar os resultados. Os resultados publicados são calculados com base nos últimos 3 dias de medições; portanto, os números de endpoints recém-listados refletem as execuções iniciais e podem mudar à medida que novas medições se acumulam.
Critérios de inclusão de modelos e provedores
Nosso objetivo é analisar e comparar modelos populares e de alto desempenho para geração de vídeo, ajudando os usuários a escolher entre eles. Por isso, aplicamos testes de relevância para o setor e de desempenho competitivo ao avaliar a inclusão de novos modelos e provedores. Aprimoramos esses critérios continuamente e aceitamos comentários ou sugestões. Para sugerir modelos ou provedores, fale conosco pela página de contato.
Declaração de independência
O benchmarking é realizado com total independência e objetividade. Não recebemos compensação de nenhum provedor pela inclusão na Artificial Analysis nem por resultados favoráveis.