Metodologia de benchmarking de geração de vídeo
Escopo e contexto
A Artificial Analysis realiza o benchmarking de modelos de geração de vídeo, normalmente disponibilizados por endpoints de API serverless. Esta página descreve a metodologia usada para medir a qualidade, a velocidade e o preço dos modelos de geração de vídeo.
Para os recursos de geração de vídeo, cobrimos seis modalidades:
- Texto para vídeo: modelos que geram vídeo usando apenas um prompt de texto.
- Imagem para vídeo: modelos que geram vídeo usando uma imagem de referência como primeiro quadro e, quando permitido, um prompt de texto complementar.
- Edição de vídeo: modelos que geram vídeo a partir de um vídeo de entrada e um prompt de texto.
- Texto para vídeo com áudio: modelos de texto para vídeo que geram áudio sincronizado junto com o vídeo.
- Imagem para vídeo com áudio: modelos de imagem para vídeo que geram áudio sincronizado junto com o vídeo.
- Edição de vídeo com áudio: modelos de edição de vídeo que geram áudio sincronizado junto com o vídeo.
Cada modalidade tem seu próprio grupo de classificação Elo no Video Arena. Assim, os resultados sem áudio e com áudio não são comparados diretamente, e a edição não é comparada com a geração.
Aplicamos um conjunto padrão de configurações a todos os vídeos que geramos, em todos os modelos e provedores. Usamos vídeos gerados com configurações idênticas para cada modelo, incluindo resolução, taxa de quadros, duração, proporção, seed, guidance e etapas de inferência, para garantir a comparabilidade. A lista completa está na seção Configurações padrão de geração abaixo.
Cobertura de endpoints
Cargas de trabalho cobertas: o benchmarking de inferência abrange endpoints de geração de texto para vídeo e imagem para vídeo.
Somente endpoints serverless públicos: o benchmarking abrange endpoints realmente serverless que estão ou estarão disponíveis ao público. Produtos de demonstração, apresentações de hardware e implantações dedicadas ou privadas estão fora do escopo.
Endpoints padrão e modificados
Classificamos cada endpoint como Padrão — oferece o modelo nativo com fidelidade total e disponibiliza seus parâmetros de entrada padrão — ou Modificado — foi alterado em relação ao modelo nativo de formas que afetam a fidelidade da saída, normalmente para aumentar a velocidade de geração ou reduzir o custo.
Os endpoints modificados recebem o rótulo Modificado na Artificial Analysis e podem ser ocultados da visualização padrão do ranking, mas continuam visíveis para quem optar por exibi-los. Para preservar a imparcialidade de nossos benchmarks padrão, reservamo-nos o direito de decidir se um endpoint deve ser classificado como Modificado — os indicadores incluem destilação, exposição parcial dos parâmetros de entrada do modelo nativo ou perda significativa de qualidade na saída — e quantas variantes de um mesmo modelo serão listadas.
Principais métricas
Usamos as métricas a seguir para acompanhar a qualidade, o desempenho e o preço dos modelos de geração de vídeo.
Elo de qualidade
A pontuação Elo de cada modelo reflete sua qualidade relativa com base nos votos dos usuários no Video Arena da Artificial Analysis. Na arena, os usuários comparam dois vídeos gerados por modelos diferentes a partir do mesmo prompt e escolhem o que preferem. Agregamos esses votos pareados usando a estimativa de máxima verossimilhança de Bradley-Terry e os redimensionamos para uma faixa semelhante à do Elo, facilitando a leitura. As classificações são recalculadas a cada hora.
O Elo é informado separadamente para cada modalidade (texto para vídeo, imagem para vídeo, edição de vídeo, texto para vídeo com áudio, imagem para vídeo com áudio e edição de vídeo com áudio), pois as disputas na arena combinam apenas resultados da mesma modalidade.
Preço por minuto de vídeo
Preço do provedor (USD) para gerar um minuto de vídeo com as configurações padrão de geração.
O preço é obtido diretamente da tarifa por minuto publicada por cada provedor.
Tempo de geração
Tempo mediano que o provedor leva para gerar um único vídeo com as configurações padrão de geração, calculado ao longo dos últimos 14 dias.
O tempo de geração é medido de ponta a ponta: do envio da solicitação ao provedor, passando pelo tempo de fila, pela inferência e pela codificação do vídeo, até o download do vídeo concluído. Para APIs assíncronas (enviar → consultar → baixar), isso inclui as três etapas.
Para modelos de imagem para vídeo, o tempo de geração também inclui o tempo necessário para enviar a imagem de referência ao provedor. Para provedores que aceitam uma URL da imagem de referência, não há etapa de upload e o tempo de geração não inclui o envio da imagem.
Configurações padrão de geração
Estas configurações se aplicam aos benchmarks de texto para vídeo e imagem para vídeo, salvo indicação em contrário.
| Configuração | Valor |
|---|---|
| Resolução | 1080p (ou o valor compatível mais próximo) |
| Taxa de quadros | 24 FPS (ou o valor compatível mais próximo) |
| Duração | 10 segundos (ou o número equivalente de quadros quando a duração precisar ser especificada em quadros) |
| Proporção | 16:9 horizontal |
| Seed | 42 (quando o modelo disponibiliza um parâmetro de seed) |
| Aprimoramento do prompt | Ativado quando recomendado pelo criador do modelo; caso contrário, desativado |
| CFG / guidance | Valor padrão da API do próprio desenvolvedor ou do repositório de código aberto |
| Etapas de inferência | Valor padrão da API do próprio desenvolvedor ou do repositório de código aberto |
Quando um provedor não oferece o padrão exato, usamos o valor compatível mais próximo, com desempate para cima (por exemplo, quando 24 FPS não está disponível, preferimos 30 FPS a 18 FPS, pois ambos estão à mesma distância do padrão). As submodalidades de texto para vídeo com áudio e imagem para vídeo com áudio avaliam modelos com a saída de áudio ativada; todos os demais padrões continuam válidos.
Texto para vídeo
Os modelos de texto para vídeo recebem um prompt de texto como única entrada. Os prompts vêm de um conjunto selecionado e reproduzível.
Imagem para vídeo
Os modelos de imagem para vídeo recebem uma imagem de referência e, quando permitido, um prompt de texto complementar. As imagens de referência usadas em nossos benchmarks seguem estes padrões:
- Formato: PNG (sem perda). Não usamos JPG/JPEG para evitar os artefatos de compressão que a codificação com perda pode introduzir.
- Resolução: 1920×1080 (16:9, correspondente à resolução de destino do vídeo).
- Envio direto de bytes: Quando um provedor não aceita URLs ou exige determinado tamanho ou formato, baixamos a imagem, aplicamos as transformações necessárias e enviamos os bytes diretamente.
- Tempo de upload: Quando um provedor exige que a imagem seja enviada à sua plataforma antes da geração, esse tempo de upload é contabilizado no tempo de geração.
Metodologia de teste do tempo de geração
Principais detalhes técnicos:
- Frequência: O teste de texto para vídeo é executado uma vez por dia, em horários aleatórios.
- Tamanho da amostra: o tempo de geração em destaque é a mediana das medições bem-sucedidas nos últimos 14 dias. Com a frequência diária, o teste de texto para vídeo costuma acumular cerca de 14 amostras por provedor em cada período.
- Seleção do prompt: cada execução seleciona um único prompt aleatório em um conjunto selecionado do banco de dados e o envia a todos os modelos hospedados ativos.
- Seed: uma seed fixa de 42 é usada quando o modelo disponibiliza esse parâmetro, permitindo reproduzir os resultados entre as execuções.
- Medição de ponta a ponta: o tempo de geração é medido de ponta a ponta, desde a primeira chamada à API até o download do vídeo concluído. Para provedores com APIs assíncronas (enviar, consultar, baixar), inclui espera na fila, inferência e download.
- Modo da API: consultamos o status da tarefa a cada 100 milissegundos para que a espera medida na fila reflita o tempo real do provedor, não a granularidade das consultas.
- Escopo: atualmente, o tempo de geração é medido apenas para modelos sem áudio de texto para vídeo e imagem para vídeo. A edição de vídeo e as três modalidades com áudio (texto para vídeo com áudio, imagem para vídeo com áudio e edição de vídeo com áudio) são classificadas pelo Video Arena (Elo de qualidade), mas não passam atualmente por benchmarking de latência.
- Agregação: a mediana, p05, p25, p75 e p95 são calculadas a partir da distribuição bruta das medições bem-sucedidas, sem remover valores atípicos.
- O que não é medido: atraso de inicialização a frio do provedor, negociações de autenticação, sobrecarga de novas tentativas e qualquer aquecimento do cliente. Cada entrada no conjunto de dados é uma única medição isolada.
- Infraestrutura: as execuções ocorrem no Google Cloud Run em us-central1.
- Novos endpoints: para endpoints recém-adicionados, inclusive os avaliados antes da disponibilidade pública, podemos ajustar a frequência do benchmarking para formar uma distribuição dos tempos de geração antes de listar os resultados. Os resultados publicados são calculados com base nos últimos 14 dias de medições; portanto, os números de endpoints recém-listados refletem as execuções iniciais e podem mudar à medida que novas medições se acumulam.
Critérios de inclusão de modelos e provedores
Nosso objetivo é analisar e comparar modelos populares e de alto desempenho para geração de vídeo, ajudando os usuários a escolher entre eles. Por isso, aplicamos testes de relevância para o setor e de desempenho competitivo ao avaliar a inclusão de novos modelos e provedores. Aprimoramos esses critérios continuamente e aceitamos comentários ou sugestões. Para sugerir modelos ou provedores, fale conosco pela página de contato.
Declaração de independência
O benchmarking é realizado com total independência e objetividade. Não recebemos compensação de nenhum provedor pela inclusão na Artificial Analysis nem por resultados favoráveis.