中文——AI 模型基准测试 比较多语言 LLM 表现

适用于中文任务的前 5 个 AI 模型是 Claude Opus 4.6 (max)、Gemini 3.1 Pro Preview、Gemini 3 Pro Preview (high)、Gemini 3 Flash 和 Claude Opus 4.5。它们在 Artificial Analysis 多语言指数中取得了最高的中文推理得分。

如需比较所有支持语言的表现,请查看完整的多语言 AI 模型基准测试页面。

🇨🇳 适用于中文的顶尖模型

#1
Claude Opus 4.6 (Max)Claude Opus 4.6 (max)
94#2
Gemini 3.1 Pro PreviewGemini 3.1 Pro Preview
94#3
Gemini 3 Pro Preview (High)Gemini 3 Pro Preview (high)
94#4
Gemini 3 Flash Preview (Reasoning)Gemini 3 Flash
93#5
Claude Opus 4.5 (Reasoning)Claude Opus 4.5
92
Multilingual Index: Chinese · Higher is better
Output tokens per second · Higher is better
USD per 1M tokens (blended) · Lower is better

多语言指数

多语言指数:中文

Artificial Analysis Multilingual Index · Higher is better

多语言指数:中文与价格

Artificial Analysis Multilingual Index · USD per 1M tokens (blended)
Most attractive quadrant

多语言指数:中文与输出速度

Artificial Analysis Multilingual Index · Output speed: output tokens per second
Most attractive quadrant

多语言指数:中文与上下文窗口

Artificial Analysis Multilingual Index · Context window: tokens limit
Most attractive quadrant

Global-MMLU-Lite

多语言 Global-MMLU-Lite:中文

Multilingual Global-MMLU-Lite · Higher is better

价格

价格:缓存命中、输入和输出

Price (USD per M Tokens)

速度与延迟

输出速度

Output tokens per second · Higher is better

延迟: 首个答案 Token 延迟

收到首个回答 token 的秒数 · 包含推理模型的“思考”时间

端到端响应时间

Seconds to output 500 tokens, including reasoning model 'thinking' time · Lower is better