中文——AI 模型基准测试 比较多语言 LLM 表现
适用于中文任务的前 5 个 AI 模型是 Claude Opus 4.6 (max)、Gemini 3.1 Pro Preview、Gemini 3 Pro Preview (high)、Gemini 3 Flash 和 Claude Opus 4.5。它们在 Artificial Analysis 多语言指数中取得了最高的中文推理得分。
如需比较所有支持语言的表现,请查看完整的多语言 AI 模型基准测试页面。
🇨🇳 适用于中文的顶尖模型
#1
Claude Opus 4.6 (max)94#2
Gemini 3.1 Pro Preview94#3
Gemini 3 Pro Preview (high)94#4
Gemini 3 Flash93#5
Claude Opus 4.592
多语言指数
多语言指数:中文
Artificial Analysis Multilingual Index · Higher is better
多语言指数:中文与价格
Artificial Analysis Multilingual Index · USD per 1M tokens (blended)
Most attractive quadrant
多语言指数:中文与输出速度
Artificial Analysis Multilingual Index · Output speed: output tokens per second
Most attractive quadrant
多语言指数:中文与上下文窗口
Artificial Analysis Multilingual Index · Context window: tokens limit
Most attractive quadrant
Global-MMLU-Lite
多语言 Global-MMLU-Lite:中文
Multilingual Global-MMLU-Lite · Higher is better
价格
价格:缓存命中、输入和输出
Price (USD per M Tokens)
速度与延迟
输出速度
Output tokens per second · Higher is better
延迟: 首个答案 Token 延迟
收到首个回答 token 的秒数 · 包含推理模型的“思考”时间
端到端响应时间
Seconds to output 500 tokens, including reasoning model 'thinking' time · Lower is better