Modelos de visão: LLMs com entrada de imagens

Compare LLMs multimodais que aceitam imagens e texto como entrada usando o Artificial Analysis Visual Reasoning Index. Compare o desempenho, os preços e a latência entre os provedores para escolher o melhor LLM com entrada de imagens para cargas de trabalho de visão. Para mais detalhes, consulte a página de metodologia.

Destaques

MMMU Pro (multimodal reasoning intelligence benchmark) · Higher is better
Output tokens per second · Higher is better
USD per 1k images at 1MP (1024x1024) · Lower is better

Resumo da análise

Raciocínio visual vs. preço da entrada de imagens

Visual reasoning intelligence: MMMU Pro evaluation · Image input price: USD per 1k images at 1MP (1024x1024)
Most attractive quadrant

Raciocínio visual vs. latência (entrada de uma imagem e 1.000 tokens de linguagem)

Visual reasoning intelligence: MMMU Pro evaluation · Seconds to first token received
Most attractive quadrant

Inteligência

Inteligência de raciocínio visual (avaliação MMMU Pro)

Visual reasoning intelligence: MMMU Pro evaluation

Preços

Pricing: Image Input Pricing

Image input price: USD per 1k images at 1MP (1024x1024)

Preços: entrada de linguagem, entrada de imagens e saída de linguagem

Price (USD per M Tokens) · Image input price: USD per 1k images at 1MP (1024x1024) · Lower is better

Latência e velocidade

Latência (entrada de uma imagem e 1.000 tokens de linguagem)

Seconds to first token received · Lower is better

Variação da latência (entrada de uma imagem e 1.000 tokens de linguagem)

Seconds to first token received · Results by percentile · Lower is better

Velocidade de saída (entrada de uma imagem e 1.000 tokens de linguagem)

Output tokens per second · Higher is better