Sprache: Deutsch – Benchmark für KI-Modelle Mehrsprachige LLM-Leistung vergleichen
Die fünf besten KI-Modelle für Aufgaben in der Sprache Deutsch sind Gemini 3.1 Pro Preview, Claude Opus 4.6 (max), Gemini 3 Pro Preview (high), Claude Opus 4.5 und Claude Opus 4.6 (high). Sie erreichen im Artificial Analysis Multilingual Index die höchsten Werte für Schlussfolgern in Deutsch.
Einen Leistungsvergleich über alle unterstützten Sprachen finden Sie auf der vollständigen Seite zum mehrsprachigen Benchmark für KI-Modelle.
🇩🇪 Führende Modelle für Deutsch
#1
Gemini 3.1 Pro Preview95#2
Claude Opus 4.6 (max)93#3
Gemini 3 Pro Preview (high)93#4
Claude Opus 4.593#5
Claude Opus 4.6 (high)93
Wichtigste Ergebnisse
Multilingual Index
Multilingual Index: Sprache Deutsch
Artificial Analysis Multilingual Index · Higher is better
Reasoning models are indicated by a lightbulb icon
Multilingual Index: Sprache Deutsch vs. Preis
Artificial Analysis Multilingual Index · USD per 1M tokens (blended)
Most attractive quadrant
Reasoning models are indicated by a lightbulb icon
Multilingual Index: Sprache Deutsch vs. Ausgabegeschwindigkeit
Artificial Analysis Multilingual Index · Output speed: output tokens per second
Most attractive quadrant
Reasoning models are indicated by a lightbulb icon
Multilingual Index: Sprache Deutsch vs. Kontextfenster
Artificial Analysis Multilingual Index · Context window: tokens limit
Most attractive quadrant
Reasoning models are indicated by a lightbulb icon
Global-MMLU-Lite
Mehrsprachiges Global-MMLU-Lite: Sprache Deutsch
Multilingual Global-MMLU-Lite · Higher is better
Reasoning models are indicated by a lightbulb icon
Preise
Pricing: Cache Hit, Input, and Output
Price (USD per M Tokens)
Reasoning models are indicated by a lightbulb icon
Geschwindigkeit und Latenz
Output Speed
Output tokens per second · Higher is better
Reasoning models are indicated by a lightbulb icon
Latency: Time To First Answer Token
Seconds to first answer token received · Accounts for reasoning model 'thinking' time
Reasoning models are indicated by a lightbulb icon
End-to-End Response Time
Seconds to output 500 tokens, including reasoning model 'thinking' time · Lower is better
Reasoning models are indicated by a lightbulb icon