日本語 - AIモデルベンチマーク 多言語LLMの性能を比較

日本語のタスクで上位5つのAIモデルは、Gemini 3.1 Pro Preview、Gemini 3 Pro Preview (high)、Claude Opus 4.6 (max)、Claude Opus 4.6 (Non-reasoning, high)、Claude Opus 4.5です。Artificial Analysis Multilingual Indexで、日本語の推論スコアが最も高いモデルです。

対応するすべての言語で性能を比較するには、多言語AIモデルベンチマークのページをご覧ください。

🇯🇵 日本語の上位モデル

#1
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
94#2
Gemini 3 Pro Preview (high)Gemini 3 Pro Preview (high)
93#3
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Claude Opus 4.6 (max)
93#4
Claude Opus 4.6 (Non-reasoning, High Effort)Claude Opus 4.6 (Non-reasoning, high)
93#5
Claude Opus 4.5 (Reasoning)Claude Opus 4.5
93

ハイライト

Multilingual Index: Japanese · Higher is better
Output tokens per second · Higher is better
USD per 1M tokens (blended) · Lower is better

Multilingual Index

Multilingual Index:日本語

Artificial Analysis Multilingual Index · Higher is better

Multilingual Index:日本語と料金

Artificial Analysis Multilingual Index · USD per 1M tokens (blended)
Most attractive quadrant

Multilingual Index:日本語と出力速度

Artificial Analysis Multilingual Index · Output speed: output tokens per second
Most attractive quadrant

Multilingual Index:日本語とコンテキストウィンドウ

Artificial Analysis Multilingual Index · Context window: tokens limit
Most attractive quadrant

Global-MMLU-Lite

多言語Global-MMLU-Lite:日本語

Multilingual Global-MMLU-Lite · Higher is better

料金

Pricing: Cache Hit, Input, and Output

Price (USD per M Tokens)

速度と遅延

Output Speed

Output tokens per second · Higher is better

Latency: Time To First Answer Token

Seconds to first answer token received · Accounts for reasoning model 'thinking' time

End-to-End Response Time

Seconds to output 500 tokens, including reasoning model 'thinking' time · Lower is better