Unabhängige Analyse von KI
Die KI-Landschaft verstehen und das beste Modell und den besten Anbieter für den eigenen Anwendungsfall auswählen
Highlights
Personalisierte Modellempfehlung
Personalisierte Empfehlungen anhand der eigenen Prioritäten für Intelligenz, Geschwindigkeit und Kosten erhalten
Agenten für allgemeine Aufgaben, Programmierung, Kundenservice und mehr entdecken
KI-Agenten nach Fähigkeiten, Preisen und Plattformunterstützung vergleichen
Premium-Tarife entdecken
Auf erweiterte Benchmark-Daten, individuelle Visualisierungen, Branchenberichte und mehr zugreifen
Intelligenz
Intelligenz führender KI-Modelle auf Grundlage unserer unabhängigen Evaluationen
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index by Open Weights / Proprietary
Cost per Intelligence Index Task
Intelligence Index vs. Cost per Intelligence Index Task
Intelligenz von Frontier-Sprachmodellen im Zeitverlauf
Leistung, Kosten und Ausführungszeit führender Programmieragenten bei durchgängigen Aufgaben der Softwareentwicklung
Artificial Analysis Coding Agent Index
Bild und Video
Führende Modelle aus den Bestenlisten unserer Image Arena und Video Arena mit 95-%-Konfidenzintervallen
Text-zu-Bild-Bestenliste
Sprache
Führende Modelle aus unserer Text to Speech Arena sowie unseren Speech-to-Text- und Speech-to-Speech-Evaluationen
Text to Speech Arena Leaderboard
Misst die Leistung von Modellen bei bestimmten Fähigkeiten und in bestimmten Branchen
Artificial Analysis Agentic Index
Intelligence Evaluations
Agentic real-world work tasks, (Elo-500)/2000
Agentic tool use
Agentic coding & terminal use
Coding
Reasoning & knowledge
Scientific reasoning
Physics reasoning
Knowledge
1 - hallucination rate
Long context reasoning
Agentic knowledge work, Elo
Agentic SaaS workflows
Legal agentic work, criterion pass rate
Agentic business operations
Instruction following
Long-horizon agentic tasks
Kubernetes incident root-cause analysis
Visual reasoning
AA-Briefcase
AA-Briefcase ist eine agentische Frontier-Evaluation für Wissensarbeit über lange Zeithorizonte. Agenten werden mit realistischen Geschäftsabläufen getestet, die Ergebnisse wie Tabellen, Präsentationen und Memos erfordern
AA-Briefcase Elo
AA-Omniscience
AA-Omniscience ist ein Benchmark für Wissen und Halluzinationen, der Genauigkeit belohnt, falsche Vermutungen bestraft und umfassend zeigt, welche Modelle in verschiedenen Bereichen sachlich zuverlässige Ausgaben erzeugen
AA-Omniscience Index
GDPval-AA v2
GDPval-AA v2 evaluiert KI-Modelle anhand realer, wirtschaftlich wertvoller Aufgaben aus zahlreichen Berufen
GDPval-AA v2 Leaderboard
Der Artificial Analysis Openness Index bewertet anhand ihrer Verfügbarkeit und Transparenz in verschiedenen Komponenten, wie „offen“ Modelle sind.
Artificial Analysis Openness Index: Components
Artificial Analysis Openness Index vs. Artificial Analysis Intelligence Index
Ausgabetokens
Ausgabetokens führender KI-Modelle auf Grundlage unserer unabhängigen Evaluationen
Output Tokens per Intelligence Index Task
Kosten
Preise und reale Kosten führender KI-Modelle auf Grundlage unserer unabhängigen Evaluationen
Cost per Intelligence Index Task
Cost to Run Artificial Analysis Intelligence Index
Pricing: Cache Hit, Input, and Output
Geschwindigkeit und Latenz
Leistungsvergleich von Erstanbieter-APIs