Vision-Modelle: LLMs mit Bildeingabe
Vergleichen Sie multimodale LLMs, die Bild- und Texteingaben unterstützen, mit dem Artificial Analysis Visual Reasoning Index. Vergleichen Sie Leistung, Preise und Latenz verschiedener Anbieter, um das beste bildfähige LLM für visuelle Workloads auszuwählen. Weitere Details finden Sie auf der Methodikseite.
Wichtigste Ergebnisse
Zusammenfassende Analyse
Visuelles Schlussfolgern vs. Preis der Bildeingabe
Visual reasoning intelligence: MMMU Pro evaluation · Image input price: USD per 1k images at 1MP (1024x1024)
Most attractive quadrant
Reasoning models are indicated by a lightbulb icon
Visuelles Schlussfolgern vs. Latenz (Eingabe: ein Bild und 1.000 Texttokens)
Visual reasoning intelligence: MMMU Pro evaluation · Seconds to first token received
Most attractive quadrant
Reasoning models are indicated by a lightbulb icon
Intelligenz
Intelligenz beim visuellen Schlussfolgern (Evaluation MMMU Pro)
Visual reasoning intelligence: MMMU Pro evaluation
Reasoning models are indicated by a lightbulb icon
Preise
Pricing: Image Input Pricing
Image input price: USD per 1k images at 1MP (1024x1024)
Reasoning models are indicated by a lightbulb icon
Preise: Texteingabe, Bildeingabe und Textausgabe
Price (USD per M Tokens) · Image input price: USD per 1k images at 1MP (1024x1024) · Lower is better
Reasoning models are indicated by a lightbulb icon
Latenz und Geschwindigkeit
Latenz (Eingabe: ein Bild und 1.000 Texttokens)
Seconds to first token received · Lower is better
Reasoning models are indicated by a lightbulb icon
Latenzvarianz (Eingabe: ein Bild und 1.000 Texttokens)
Seconds to first token received · Results by percentile · Lower is better
Reasoning models are indicated by a lightbulb icon
Ausgabegeschwindigkeit (Eingabe: ein Bild und 1.000 Texttokens)
Output tokens per second · Higher is better
Reasoning models are indicated by a lightbulb icon
