Benchmarks de agentes de programação da Artificial Analysis

Medimos o desempenho no mundo real de agentes de programação em tarefas de engenharia de software, incluindo custo, uso de tokens e tempo de execução. Comparamos como o desempenho muda entre agentes, modelos e configurações de execução.

Para comparar modelos de linguagem, consulte nossos benchmarks de modelos.

Artificial Analysis Coding Agent Index

Índice composto de 3 benchmarks:

Cada pontuação de benchmark calcula a média de pass@1 em três tentativas por tarefa. O Índice atribui peso igual aos seus 3 componentes de benchmark. Consulte a metodologia para ver os detalhes de pontuação e o histórico de versões.

Destaques

Updated
Artificial Analysis Coding Agent Index v1.5 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

DesempenhoUpdated

Desempenho no Artificial Analysis Coding Agent Index.

Artificial Analysis Coding Agent Index

Artificial Analysis Coding Agent Index v1.5 incorporates 3 benchmarks: DeepSWE v1.1, Terminal-Bench 4.0, and SWE-Atlas-QnA · Higher is better

Artificial Analysis Coding Agent Index vs. custo por tarefa

Artificial Analysis Coding Agent Index vs. média do custo da API de pagamento por token por tarefa (USD)
Most attractive quadrant
Pareto line

Comparação de harness

Em breve

Uso de tokens

Consumo de tokens no Artificial Analysis Coding Agent Index, incluindo uso total, distribuição de tokens, eficiência e detalhamentos por benchmark.

Uso de tokens por tarefa

Média de tokens de entrada, cache e saída por tarefa
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.

Artificial Analysis Coding Agent Index vs. tokens totais

Artificial Analysis Coding Agent Index vs. média de tokens totais por tarefa
Most attractive quadrant

Custo

Custo no Artificial Analysis Coding Agent Index com base nos preços atuais da API por token, incluindo o preço de gravação de cache e os descontos de cache quando disponíveis. Muitos usuários acessarão os harnesses de agentes de programação por meio de planos de assinatura em vez de pagamento por token.

Custo por tarefa

Average pay-per-token API cost per task (USD) · Lower is better

Tempo de execução

Tempo de execução ativo do agente no Artificial Analysis Coding Agent Index.

Tempo por tarefa

Average agent wall time per task · Lower is better

Artificial Analysis Coding Agent Index vs. tempo de execução

Artificial Analysis Coding Agent Index vs. média do tempo de execução do agente por tarefa
Most attractive quadrant

Perguntas frequentes