根据 Artificial Analysis Coding Agent Index并排比较编程智能体,包括基准测试表现、成本、执行时间和 token 用量。
如需比较语言模型,请参阅我们的模型基准测试。
选择两个编程智能体,并排查看性能、成本、每任务耗时和 token 用量。结果采用与编程智能体指数相同的评测。
Claude Code
Sonnet 5.5 (max)
Codex
GPT-6.1 Sol (xhigh)
Opencode
GLM-5.3