模型比较:智能、性能与价格分析
立即试用智能
Updated智能Updated
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index:开放权重与专有模型
衡量模型在特定能力和行业中的表现
Artificial Analysis 财务与会计指数
Intelligence Evaluations
Agentic knowledge work, (Elo-500)/2000
Agentic real-world work tasks, (Elo-500)/2000
Agentic SaaS workflows
Agentic coding & terminal use
Coding
Reasoning & knowledge
Professional document reasoning, All-pass
Physics reasoning
Knowledge
1 - hallucination rate
Long context reasoning
Legal agentic work, criterion pass rate
Agentic business operations
Agentic scientific research workflows in a terminal
Quantitative analysis on spreadsheets & documents
Kubernetes incident root-cause analysis
Visual reasoning
Medical long context reasoning
AA-Briefcase v1.1Updated
AA-Briefcase Elo
AA-Omniscience
AA-Omniscience Index
开放性指数
Artificial Analysis 开放性指数:得分
Intelligence Index 比较
Intelligence Index 与每项任务的成本
Token 使用量
智能指数每项任务的输出 Token 数
成本
每项 Intelligence Index 任务的成本
运行 Artificial Analysis Intelligence Index 的成本
价格:缓存命中、输入和输出
上下文窗口
上下文窗口
速度
按输出速度(每秒 token 数)衡量
输出速度
智能指数每项任务耗时
延迟
按首 Token 延迟(秒)衡量
延迟: 首个答案 Token 延迟
端到端响应时间
Seconds to output 500 tokens, calculated based on time to first token, 'thinking' time for reasoning models, and output speed
端到端响应时间
模型规模(仅开放权重模型)
模型规模:总参数量与活跃参数量
常见问题
在已评测的 198 个模型中,Claude Opus 5.5 (Max, Default Fallback) 目前以 58 分领跑 Artificial Analysis Intelligence Index。
按 Intelligence Index 排名,顶尖 AI 模型是:1. Claude Opus 5.5 (Max, Default Fallback)(58)、2. Claude Sonnet 5.5 (Max, Default Fallback)(56)、3. Claude Opus 5.5 (Xhigh, Default Fallback)(56)、4. Claude Opus 5.5 (High, Default Fallback)(54)和5. Claude Fable 5.1 (Max, Default Fallback)(53)。
Celeris-1 最快,输出速度为每秒 1,656.6 个 token,其次是 Mercury 2(698.1 t/s)和 Mercury 2.5(660.6 t/s)。
Llama 3.1 Instruct 8B 最实惠,混合价格为每 100 万 token $0.02,其次是 Granite 4.2 3B($0.02)和 Nova Micro($0.03)。
Gemini 2.5 Flash-Lite (Non-reasoning) 的首 Token 延迟最低,为 0.31 秒,其次是 Nemotron 3 Nano Omni 30B A3B Reasoning(0.35 秒)和 North Mini Code(0.42 秒)。
MiMo-V2.6-Pro 是排名最高的开放权重模型,Intelligence Index 得分为 46。总计评测的 198 个模型中,有 81 个开放权重模型。
按 Intelligence Index 排名,顶尖开放权重 AI 模型是:1. MiMo-V2.6-Pro(46)、2. GLM-5.3 (Max)(45)和3. Kimi K3 (Max)(44)。
在 176 个推理模型中,Claude Opus 5.5 (Max, Default Fallback) 以 58 的 Intelligence Index 得分领先。推理模型会先通过扩展思考来解决复杂问题,再给出回答。
模型会在多个维度上进行比较,包括智能(质量)、价格、输出速度(每秒 token 数)、延迟(首 Token 延迟)、端到端响应时间和上下文窗口大小。性能指标通过标准化提示词,在 690 个模型上直接测量。
点击图表中的任意模型名称或行,即可打开该模型的专属页面,查看详细指标并与类似模型直接比较。您还可以使用模型选择器,自定义每张图表中显示的模型。 查看排行榜