Benchmarks de agentes de programación de Artificial Analysis

Medimos el rendimiento en el mundo real de los agentes de programación en tareas de ingeniería de software, incluyendo costo, uso de tokens y tiempo de ejecución. Comparamos cómo cambia el rendimiento entre agentes, modelos y configuraciones de ejecución.

Para comparar modelos de lenguaje, consulta nuestros benchmarks de modelos.

Índice de agentes de programación de Artificial Analysis

Índice compuesto de 3 benchmarks:

Cada puntaje de benchmark promedia pass@1 en tres intentos por tarea. El Índice otorga el mismo peso a sus 3 componentes de benchmark. Consulta la metodología para ver los detalles de puntuación y el historial de versiones.

Destacados

Artificial Analysis Coding Agent Index v1.4 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

Rendimiento

Rendimiento en el Índice de agentes de programación de Artificial Analysis.

Índice de agentes de programación de Artificial Analysis

Artificial Analysis Coding Agent Index v1.4 incorporates 3 benchmarks: DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA · Higher is better
Since benchmarking, we have observed a higher rate of content safety filtering on this endpoint.

The Artificial Analysis Coding Agent Index is a composite score built from DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA.

It is useful for quick comparison, but it should be read alongside the per-eval breakdowns. Two agents with similar index values can still have different strengths across repository tasks, terminal workflows, and rubric-based evaluations.

Comparación de harness

Índice de agentes de programación de Artificial Analysis por harness para Claude Opus 4.7.

Comparación de harness: Índice de agentes de programación de Artificial Analysis

Composite average pass@1 across Claude Code, Cursor CLI, and Opencode for Claude Opus 4.7 · Higher is better

This chart holds the underlying model constant at Claude Opus 4.7 and compares how it performs across different coding-agent harnesses, including Cursor, Claude Code, and OpenCode.

Uso de tokens

Consumo de tokens en el Índice de agentes de programación de Artificial Analysis, incluyendo uso total, distribución de tokens, eficiencia y desgloses por benchmark.

Uso de tokens por tarea

Promedio de tokens de entrada, caché y salida por tarea
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.

Non-cached input tokens sent to the model, including prompts, instructions, tool context, and task context that were not served from prompt cache.

Índice de agentes de programación de Artificial Analysis vs. tokens totales

Índice de agentes de programación de Artificial Analysis vs. promedio de tokens totales por tarea
Most attractive quadrant

Each point represents a coding-agent variant. Farther left means lower average total token usage per task, while higher on the chart means higher benchmark performance. Agents toward the upper-left achieve stronger results with fewer tokens.

Costo

Costo en el Índice de agentes de programación de Artificial Analysis según los precios actuales de la API por token, incluyendo el precio de escritura de caché y los descuentos de caché cuando están disponibles. Muchos usuarios accederán a los harness de agentes de programación mediante planes de suscripción en lugar de pago por token.

Costo por tarea

Average pay-per-token API cost per task (USD) · Lower is better

This chart shows the average pay-per-token API cost per task across the Artificial Analysis Coding Agent Index, spanning DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA.

Where applicable, that cost model includes standard input pricing, discounted cached-input pricing, separate cache-write charges, and output pricing rather than treating all prompt tokens as if they were billed at the same uncached input rate.

It is intended to show pay-per-token API cost, not consumer plan pricing or the full operational cost of deploying the system in production. Infrastructure, engineering, and supervision costs are not the focus of this metric.

Índice de agentes de programación de Artificial Analysis vs. costo por tarea

Índice de agentes de programación de Artificial Analysis vs. promedio del costo de la API de pago por token por tarea (USD)
Most attractive quadrant
Pareto line

Each point represents a coding-agent variant. Farther left means lower average cost per task, while higher on the chart means higher benchmark performance. The most efficient agents sit toward the upper-left: stronger results at lower cost.

Tiempo de ejecución

Tiempo de ejecución activo del agente en el Índice de agentes de programación de Artificial Analysis.

Tiempo por tarea

Average agent wall time per task · Lower is better

This chart uses agent wall time: how long the agent process was actively running on each task.

It does not include environment startup, verifier or judge time, or other harness overhead, so it is a cleaner comparison of how long the agent itself was working.

Índice de agentes de programación de Artificial Analysis vs. tiempo de ejecución

Índice de agentes de programación de Artificial Analysis vs. promedio del tiempo de ejecución del agente por tarea
Most attractive quadrant

Each point represents a coding-agent variant. Farther left means shorter average agent runtime per task, while higher on the chart means higher benchmark performance. Agents toward the upper-left deliver stronger results in less active agent time.

Preguntas frecuentes

El Índice de agentes de programación de Artificial Analysis es nuestro puntaje compuesto del rendimiento de los agentes de programación en el conjunto de benchmarks públicos de esta página. Combina DeepSWE, Terminal-Bench v2.1 y SWE-Atlas-QnA para capturar en una sola métrica principal la implementación, el flujo de trabajo en terminal, la comprensión de repositorios y el rendimiento más amplio en ingeniería de software.

El índice público actual incluye DeepSWE, Terminal-Bench v2.1 y SWE-Atlas-QnA. Estos benchmarks se combinan porque ponen a prueba distintas partes del flujo de trabajo del agente de programación en lugar de repetir el mismo formato de tarea.

El conjunto de benchmarks públicos combina varios estilos de tareas de ingeniería de software. Algunas son tareas de preguntas y respuestas y de comprensión de repositorios, centradas en leer una base de código, entender su arquitectura o comportamiento y producir una respuesta técnica correcta. Otras son tareas de implementación y corrección de errores que requieren cambios de código y se acercan al planteamiento clásico de hacer un parche que funcione. Otras son tareas de flujo de trabajo en terminal que evalúan si el agente puede desenvolverse en un entorno basado en shell, ejecutar herramientas correctamente y completar un flujo de trabajo de línea de comandos de varios pasos. Los tres benchmarks actuales usan resultados de tarea binarios.

Las tareas tipo preguntas y respuestas enfatizan la comprensión del repositorio, la lectura de código, el rastreo del comportamiento y la producción de una explicación técnica correcta. Las tareas tipo implementación se acercan más a entregar un cambio funcional: el agente tiene que entender la tarea, desenvolverse en el repositorio, editar archivos correctamente y satisfacer un evaluador o un resultado basado en pruebas bajo restricciones de ejecución. Son capacidades relacionadas, pero no idénticas. Un agente puede ser fuerte en el razonamiento sobre repositorios y aun así ser más débil en la ejecución confiable de parches, o viceversa, lo cual es una razón por la que el índice compuesto debe interpretarse junto con el gráfico por benchmark.

La página del benchmark reporta el promedio de pass@1 normalizado por tarea. Para cada benchmark, primero promediamos los tres intentos evaluados de cada tarea y luego promediamos esos puntajes por tarea para que cada tarea tenga el mismo peso. Todos los resultados de los componentes actuales son binarios. Un intento puede completarse sin errores y aun así obtener cero cuando no satisface su verificador. La puntuación binaria de aprobado/reprobado de SWE-Atlas-QnA está alineada con la metodología Task Resolve Rate de Scale AI.

El índice se calcula a partir de DeepSWE, Terminal-Bench v2.1 y SWE-Atlas-QnA. Para el Índice de agentes de programación de Artificial Analysis actual, la metodología pública es un promedio simple de esos puntajes de benchmark. La metodología de los benchmarks puede evolucionar a medida que mejora la cobertura, por lo que la comparabilidad se interpreta mejor dentro del conjunto de benchmarks publicado y su conjunto de componentes actual, en lugar de como un puntaje absoluto atemporal.

El tiempo de ejecución en esta página se refiere al tiempo transcurrido promedio por tarea, no solo a la latencia del modelo. Busca reflejar el costo de tiempo, desde la perspectiva del usuario, de ejecutar todo el flujo de trabajo del agente. Eso incluye el tiempo dedicado a razonar, emitir llamadas a herramientas, leer y escribir archivos, ejecutar pasos de shell y esperar las respuestas del modelo. Así, un agente puede tener un modelo subyacente rápido y aun así ser más lento en general si su flujo de trabajo es más largo o depende más de herramientas.

El uso de tokens es el consumo promedio observado de tokens por tarea en el conjunto de benchmarks. En esta página lo desglosamos en tokens de entrada, caché y salida. Los tokens de entrada son los que se envían al modelo, incluyendo prompts, instrucciones, contexto de herramientas y contexto de la tarea. Los tokens de caché son tokens de prompt reutilizados mediante caché de prompts cuando el proveedor expone esa telemetría. Los tokens de salida son los que genera el modelo en su respuesta. El uso de tokens importa porque a menudo determina el costo y también puede indicar cuánto contexto consume un agente para realizar el trabajo, pero la eficiencia de tokens y el costo no son idénticos porque los proveedores fijan precios distintos para cada categoría de tokens y la caché puede cambiar significativamente la factura.

Un puntaje de índice más alto significa un mejor rendimiento en la mezcla de benchmarks incluida, pero no significa que el agente sea el mejor para todos los flujos de trabajo. El índice es un equilibrio entre la calidad de los benchmarks, no una medida directa de tus prioridades específicas de latencia, costo, herramientas o tipo de tarea. La elección en el mundo real todavía depende de si tu flujo de trabajo se parece más a preguntas y respuestas sobre repositorios, aplicación de parches o ejecución en terminal, y de restricciones prácticas como la integración con el IDE, la disponibilidad del modelo y la confiabilidad.

Estos benchmarks miden el rendimiento de los agentes de programación en repositorios, herramientas, flujos de trabajo de varios pasos y resultados basados en evaluadores. Los resultados de esta página reflejan variantes específicas de agentes evaluadas, no solo nombres genéricos de productos: la elección del modelo, la configuración y los ajustes de ejecución pueden cambiar significativamente los resultados, razón por la cual una misma familia de agentes puede aparecer en varias variantes en los resultados. Para más información sobre las ejecuciones de benchmarks, la puntuación por tarea y la metodología, consulta la página de metodología de benchmarking de agentes de programación. Ver la metodología de benchmarking de agentes de programación