Benchmarks de agentes de programação da Artificial Analysis

Medimos o desempenho no mundo real de agentes de programação em tarefas de engenharia de software, incluindo custo, uso de tokens e tempo de execução. Comparamos como o desempenho muda entre agentes, modelos e configurações de execução.

Para comparar modelos de linguagem, consulte nossos benchmarks de modelos.

Artificial Analysis Coding Agent Index

Índice composto de 3 benchmarks:

Cada pontuação de benchmark calcula a média de pass@1 em três tentativas por tarefa. O Índice atribui peso igual aos seus 3 componentes de benchmark. Consulte a metodologia para ver os detalhes de pontuação e o histórico de versões.

Destaques

Artificial Analysis Coding Agent Index v1.4 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

Desempenho

Desempenho no Artificial Analysis Coding Agent Index.

Artificial Analysis Coding Agent Index

Artificial Analysis Coding Agent Index v1.4 incorporates 3 benchmarks: DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA · Higher is better
Since benchmarking, we have observed a higher rate of content safety filtering on this endpoint.

The Artificial Analysis Coding Agent Index is a composite score built from DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA.

It is useful for quick comparison, but it should be read alongside the per-eval breakdowns. Two agents with similar index values can still have different strengths across repository tasks, terminal workflows, and rubric-based evaluations.

Comparação de harness

Artificial Analysis Coding Agent Index por harness para Claude Opus 4.7.

Comparação de harness: Artificial Analysis Coding Agent Index

Composite average pass@1 across Claude Code, Cursor CLI, and Opencode for Claude Opus 4.7 · Higher is better

This chart holds the underlying model constant at Claude Opus 4.7 and compares how it performs across different coding-agent harnesses, including Cursor, Claude Code, and OpenCode.

Uso de tokens

Consumo de tokens no Artificial Analysis Coding Agent Index, incluindo uso total, distribuição de tokens, eficiência e detalhamentos por benchmark.

Uso de tokens por tarefa

Média de tokens de entrada, cache e saída por tarefa
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.

Non-cached input tokens sent to the model, including prompts, instructions, tool context, and task context that were not served from prompt cache.

Artificial Analysis Coding Agent Index vs. tokens totais

Artificial Analysis Coding Agent Index vs. média de tokens totais por tarefa
Most attractive quadrant

Each point represents a coding-agent variant. Farther left means lower average total token usage per task, while higher on the chart means higher benchmark performance. Agents toward the upper-left achieve stronger results with fewer tokens.

Custo

Custo no Artificial Analysis Coding Agent Index com base nos preços atuais da API por token, incluindo o preço de gravação de cache e os descontos de cache quando disponíveis. Muitos usuários acessarão os harnesses de agentes de programação por meio de planos de assinatura em vez de pagamento por token.

Custo por tarefa

Average pay-per-token API cost per task (USD) · Lower is better

This chart shows the average pay-per-token API cost per task across the Artificial Analysis Coding Agent Index, spanning DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA.

Where applicable, that cost model includes standard input pricing, discounted cached-input pricing, separate cache-write charges, and output pricing rather than treating all prompt tokens as if they were billed at the same uncached input rate.

It is intended to show pay-per-token API cost, not consumer plan pricing or the full operational cost of deploying the system in production. Infrastructure, engineering, and supervision costs are not the focus of this metric.

Artificial Analysis Coding Agent Index vs. custo por tarefa

Artificial Analysis Coding Agent Index vs. média do custo da API de pagamento por token por tarefa (USD)
Most attractive quadrant
Pareto line

Each point represents a coding-agent variant. Farther left means lower average cost per task, while higher on the chart means higher benchmark performance. The most efficient agents sit toward the upper-left: stronger results at lower cost.

Tempo de execução

Tempo de execução ativo do agente no Artificial Analysis Coding Agent Index.

Tempo por tarefa

Average agent wall time per task · Lower is better

This chart uses agent wall time: how long the agent process was actively running on each task.

It does not include environment startup, verifier or judge time, or other harness overhead, so it is a cleaner comparison of how long the agent itself was working.

Artificial Analysis Coding Agent Index vs. tempo de execução

Artificial Analysis Coding Agent Index vs. média do tempo de execução do agente por tarefa
Most attractive quadrant

Each point represents a coding-agent variant. Farther left means shorter average agent runtime per task, while higher on the chart means higher benchmark performance. Agents toward the upper-left deliver stronger results in less active agent time.

Perguntas frequentes

O Artificial Analysis Coding Agent Index é a nossa pontuação composta do desempenho de agentes de programação no conjunto de benchmarks públicos desta página. Ele combina DeepSWE, Terminal-Bench v2.1 e SWE-Atlas-QnA para capturar implementação, fluxo de trabalho em terminal, compreensão de repositórios e o desempenho mais amplo em engenharia de software em uma única métrica principal.

O índice público atual inclui DeepSWE, Terminal-Bench v2.1 e SWE-Atlas-QnA. Esses benchmarks são combinados porque exigem partes diferentes do fluxo de trabalho do agente de programação, em vez de repetir o mesmo formato de tarefa.

O conjunto de benchmarks públicos combina vários estilos de tarefas de engenharia de software. Algumas são tarefas de perguntas e respostas e de compreensão de repositórios, focadas em ler uma base de código, entender a arquitetura ou o comportamento e produzir uma resposta técnica correta. Outras são tarefas de implementação e correção de bugs que exigem alterações de código e se aproximam da abordagem clássica de fazer-um-patch-que-funcione. Outras são tarefas de fluxo de trabalho em terminal que testam se o agente consegue navegar em um ambiente baseado em shell, executar ferramentas corretamente e concluir um fluxo de trabalho de linha de comando com várias etapas. Os três benchmarks atuais usam resultados de tarefa binários.

As tarefas do tipo perguntas e respostas enfatizam a compreensão do repositório, a leitura de código, o rastreamento do comportamento e a produção de uma explicação técnica correta. As tarefas do tipo implementação se aproximam mais de entregar uma alteração funcional: o agente precisa entender a tarefa, navegar pelo repositório, editar arquivos corretamente e satisfazer um avaliador ou um resultado baseado em testes sob restrições de execução. São capacidades relacionadas, mas não idênticas. Um agente pode ser forte no raciocínio sobre repositórios e ainda assim ser mais fraco na execução confiável de patches, ou vice-versa, o que é um dos motivos pelos quais o índice composto deve ser interpretado junto com o gráfico por benchmark.

A página do benchmark reporta a média de pass@1 normalizada por tarefa. Para cada benchmark, primeiro calculamos a média das três tentativas avaliadas de cada tarefa e depois a média dessas pontuações por tarefa para que cada tarefa tenha peso igual. Todos os resultados dos componentes atuais são binários. Uma tentativa pode ser concluída sem erros e ainda assim receber zero quando não satisfaz o seu verificador. A pontuação binária de aprovado/reprovado do SWE-Atlas-QnA está alinhada com a metodologia Task Resolve Rate da Scale AI.

O índice é calculado a partir de DeepSWE, Terminal-Bench v2.1 e SWE-Atlas-QnA. Para o Artificial Analysis Coding Agent Index atual, a metodologia pública é uma média simples dessas pontuações de benchmark. A metodologia dos benchmarks pode evoluir à medida que a cobertura melhora, por isso a comparabilidade é melhor interpretada dentro do conjunto de benchmarks publicado e do seu conjunto de componentes atual, em vez de como uma pontuação absoluta atemporal.

O tempo de execução nesta página se refere ao tempo de execução médio por tarefa medido em tempo real, não apenas à latência do modelo. Ele busca refletir o custo de tempo, na perspectiva do usuário, de executar todo o fluxo de trabalho do agente. Isso inclui o tempo gasto raciocinando, emitindo chamadas de ferramentas, lendo e escrevendo arquivos, executando etapas de shell e aguardando as respostas do modelo. Assim, um agente pode ter um modelo subjacente rápido e ainda ser mais lento no geral se o seu fluxo de trabalho for mais longo ou depender mais de ferramentas.

O uso de tokens é o consumo médio observado de tokens por tarefa no conjunto de benchmarks. Nesta página, nós o dividimos em tokens de entrada, cache e saída. Os tokens de entrada são os enviados ao modelo, incluindo prompts, instruções, contexto de ferramentas e contexto da tarefa. Os tokens de cache são tokens de prompt reutilizados por meio de cache de prompts quando o provedor expõe essa telemetria. Os tokens de saída são os gerados pelo modelo em sua resposta. O uso de tokens importa porque muitas vezes determina o custo e também pode indicar quanto contexto um agente consome para realizar o trabalho, mas a eficiência de tokens e o custo não são idênticos, porque os provedores precificam categorias de tokens de forma diferente e o cache pode mudar significativamente a fatura.

Uma pontuação de índice mais alta significa um desempenho mais forte na combinação de benchmarks incluída, mas não significa que o agente seja o melhor para todos os fluxos de trabalho. O índice é um equilíbrio entre a qualidade dos benchmarks, não uma medida direta das suas prioridades específicas de latência, custo, ferramentas ou tipo de tarefa. A escolha no mundo real ainda depende de o seu fluxo de trabalho se parecer mais com perguntas e respostas sobre repositórios, aplicação de patches ou execução em terminal, e de restrições práticas como integração com o IDE, disponibilidade do modelo e confiabilidade.

Esses benchmarks medem o desempenho de agentes de programação em repositórios, ferramentas, fluxos de trabalho de várias etapas e resultados baseados em avaliadores. Os resultados desta página refletem variantes específicas de agentes avaliadas, não apenas nomes genéricos de produtos: a escolha do modelo, as configurações e os ajustes de execução podem mudar significativamente os resultados, razão pela qual uma mesma família de agentes pode aparecer em várias variantes nos resultados. Para mais informações sobre as execuções de benchmarks, a pontuação por tarefa e a metodologia, consulte a página de metodologia de benchmarking de agentes de programação. Ver a metodologia de benchmarking de agentes de programação