Benchmarks de agentes de programación de Artificial Analysis

Medimos el rendimiento en el mundo real de los agentes de programación en tareas de ingeniería de software, incluyendo costo, uso de tokens y tiempo de ejecución. Comparamos cómo cambia el rendimiento entre agentes, modelos y configuraciones de ejecución.

Para comparar modelos de lenguaje, consulta nuestros benchmarks de modelos.

Índice de agentes de programación de Artificial Analysis

Índice compuesto de 3 benchmarks:

Cada puntaje de benchmark promedia pass@1 en tres intentos por tarea. El Índice otorga el mismo peso a sus 3 componentes de benchmark. Consulta la metodología para ver los detalles de puntuación y el historial de versiones.

Destacados

Updated
Artificial Analysis Coding Agent Index v1.5 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

RendimientoUpdated

Rendimiento en el Índice de agentes de programación de Artificial Analysis.

Índice de agentes de programación de Artificial Analysis

Artificial Analysis Coding Agent Index v1.5 incorporates 3 benchmarks: DeepSWE v1.1, Terminal-Bench 4.0, and SWE-Atlas-QnA · Higher is better

Índice de agentes de programación de Artificial Analysis vs. costo por tarea

Índice de agentes de programación de Artificial Analysis vs. promedio del costo de la API de pago por token por tarea (USD)
Most attractive quadrant
Pareto line

Comparación de harness

Próximamente

Uso de tokens

Consumo de tokens en el Índice de agentes de programación de Artificial Analysis, incluyendo uso total, distribución de tokens, eficiencia y desgloses por benchmark.

Uso de tokens por tarea

Promedio de tokens de entrada, caché y salida por tarea
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.

Índice de agentes de programación de Artificial Analysis vs. tokens totales

Índice de agentes de programación de Artificial Analysis vs. promedio de tokens totales por tarea
Most attractive quadrant

Costo

Costo en el Índice de agentes de programación de Artificial Analysis según los precios actuales de la API por token, incluyendo el precio de escritura de caché y los descuentos de caché cuando están disponibles. Muchos usuarios accederán a los harness de agentes de programación mediante planes de suscripción en lugar de pago por token.

Costo por tarea

Average pay-per-token API cost per task (USD) · Lower is better

Tiempo de ejecución

Tiempo de ejecución activo del agente en el Índice de agentes de programación de Artificial Analysis.

Tiempo por tarea

Average agent wall time per task · Lower is better

Índice de agentes de programación de Artificial Analysis vs. tiempo de ejecución

Índice de agentes de programación de Artificial Analysis vs. promedio del tiempo de ejecución del agente por tarea
Most attractive quadrant

Preguntas frecuentes