Modelos de visión: LLM con capacidades de entrada de imagen
Compara LLM multimodales que admiten entrada de imagen y texto con el Índice de Razonamiento Visual de Artificial Analysis. Compara rendimiento, precios y latencia entre proveedores para elegir el mejor LLM con capacidades de imagen para cargas de visión. Para más detalles, consulta la página de metodología.
Aspectos destacados
Resumen del análisis
Razonamiento visual vs. precio de entrada de imagen
Visual reasoning intelligence: MMMU Pro evaluation · Image input price: USD per 1k images at 1MP (1024x1024)
Most attractive quadrant
Reasoning models are indicated by a lightbulb icon
Razonamiento visual vs. latencia (entrada de una imagen y 1,000 tokens de lenguaje)
Visual reasoning intelligence: MMMU Pro evaluation · Seconds to first token received
Most attractive quadrant
Reasoning models are indicated by a lightbulb icon
Inteligencia
Inteligencia de razonamiento visual (evaluación MMMU Pro)
Visual reasoning intelligence: MMMU Pro evaluation
Reasoning models are indicated by a lightbulb icon
Precios
Pricing: Image Input Pricing
Image input price: USD per 1k images at 1MP (1024x1024)
Reasoning models are indicated by a lightbulb icon
Precios: entrada de lenguaje, entrada de imagen y salida de lenguaje
Price (USD per M Tokens) · Image input price: USD per 1k images at 1MP (1024x1024) · Lower is better
Reasoning models are indicated by a lightbulb icon
Latencia y velocidad
Latencia (entrada de una imagen y 1,000 tokens de lenguaje)
Seconds to first token received · Lower is better
Reasoning models are indicated by a lightbulb icon
Varianza de latencia (entrada de una imagen y 1,000 tokens de lenguaje)
Seconds to first token received · Results by percentile · Lower is better
Reasoning models are indicated by a lightbulb icon
Velocidad de salida (entrada de una imagen y 1,000 tokens de lenguaje)
Output tokens per second · Higher is better
Reasoning models are indicated by a lightbulb icon
