Multilingual AI Model Benchmark Compare Leading LLMs by Language

Explore how leading large language models (LLMs) perform across multiple languages on Artificial Analysis' Multilingual Index, including the Global-MMLU-Lite benchmark. Filter by language and model, view trade-offs between accuracy, speed, and cost, and find the best LLM for your multilingual use case.

For details on datasets and methodology, see the FAQ page.

๐ŸŒAll (average)

Top Models
#1
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
93#2
Gemini 3 Pro Preview (high)Gemini 3 Pro Preview (high)
92#3
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Claude Opus 4.6 (max)
92#4
Gemini 3 Flash Preview (Reasoning)Gemini 3 Flash
91#5
Claude Opus 4.5 (Reasoning)Claude Opus 4.5
91

๐Ÿ‡ฌ๐Ÿ‡งEnglish

Top Models
#1
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Claude Opus 4.6 (max)
95#2
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
95#3
Gemini 3 Flash Preview (Reasoning)Gemini 3 Flash
95#4
Claude Opus 4.5 (Non-reasoning)Claude Opus 4.5 (Non-reasoning)
94#5
GPT-5.1 (high)GPT-5.1 (high)
94

๐Ÿ‡จ๐Ÿ‡ณChinese

Top Models
#1
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Claude Opus 4.6 (max)
94#2
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
94#3
Gemini 3 Pro Preview (high)Gemini 3 Pro Preview (high)
94#4
Gemini 3 Flash Preview (Reasoning)Gemini 3 Flash
93#5
Claude Opus 4.5 (Reasoning)Claude Opus 4.5
92

๐Ÿ‡ฎ๐Ÿ‡ณHindi

Top Models
#1
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
94#2
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Claude Opus 4.6 (max)
92#3
Gemini 3 Pro Preview (high)Gemini 3 Pro Preview (high)
91#4
GPT-5 (high)GPT-5 (high)
91#5
Claude Opus 4.5 (Non-reasoning)Claude Opus 4.5 (Non-reasoning)
91

๐Ÿ‡ช๐Ÿ‡ธSpanish

Top Models
#1
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
94#2
Gemini 3 Pro Preview (high)Gemini 3 Pro Preview (high)
94#3
Gemini 3 Flash Preview (Reasoning)Gemini 3 Flash
94#4
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Claude Opus 4.6 (max)
94#5
Claude Opus 4.5 (Non-reasoning)Claude Opus 4.5 (Non-reasoning)
94

๐Ÿ‡ซ๐Ÿ‡ทFrench

Top Models
#1
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
94#2
GPT-5.1 (high)GPT-5.1 (high)
94#3
Gemini 3 Pro Preview (high)Gemini 3 Pro Preview (high)
93#4
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Claude Opus 4.6 (max)
93#5
GPT-5 (high)GPT-5 (high)
93

Other Countries

๐Ÿ‡ธ๐Ÿ‡ฆ Arabic
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
๐Ÿ‡ง๐Ÿ‡ฉ Bangla
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
๐Ÿ‡ต๐Ÿ‡น Portuguese
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
๐Ÿ‡ฎ๐Ÿ‡ฉ Indonesian
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
๐Ÿ‡ฏ๐Ÿ‡ต Japanese
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
๐Ÿ‡ฐ๐Ÿ‡ช Swahili
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
๐Ÿ‡ฉ๐Ÿ‡ช German
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
๐Ÿ‡ฐ๐Ÿ‡ท Korean
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Claude Opus 4.6 (max)
๐Ÿ‡ฎ๐Ÿ‡น Italian
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
๐Ÿ‡ณ๐Ÿ‡ฌ Yoruba
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
๐Ÿ‡ฒ๐Ÿ‡ฒ Burmese
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview

Overview

Artificial Analysis Multilingual Index

Higher is better

Multilingual Index Across Languages (Normalized)

Scores are normalized per language across all models tested, where green represents the highest score for that language and red represents the lowest score for that language.

Multilingual Index

Multilingual Index: Average Across All Languages

Artificial Analysis Multilingual Index ยท Average across all languages ยท Higher is better

Multilingual Index: Average vs. Output Speed

Artificial Analysis Multilingual Index ยท Output speed: output tokens per second
Most attractive quadrant

Multilingual Index: Average vs. Price

Artificial Analysis Multilingual Index ยท Average across all languages
Most attractive quadrant

Global-MMLU-Lite

Multilingual Global-MMLU-Lite: Average

Average across all languages ยท Higher is better

Pricing

Pricing: Cache Hit, Input, and Output

Price (USD per M Tokens)

Speed & Latency

Output Speed

Output tokens per second ยท Higher is better

Latency: Time To First Answer Token

Seconds to first answer token received ยท Accounts for reasoning model 'thinking' time

End-to-End Response Time

Seconds to output 500 tokens, including reasoning model 'thinking' time ยท Lower is better