根据 Artificial Analysis Coding Agent Index并排比较编程智能体,包括基准测试表现、成本、执行时间和 token 用量。
如需比较语言模型,请参阅我们的模型基准测试。
选择两个编程智能体,并排查看性能、成本、每任务耗时和 token 用量。结果采用与编程智能体指数相同的评测。
Claude Code
Fable 5.1 (max) (with fallback)
Codex
GPT-6 Astra (max)
Opencode
GLM-5.3