Benchmarks de agentes de programación de Artificial Analysis
Medimos el rendimiento en el mundo real de los agentes de programación en tareas de ingeniería de software, incluyendo costo, uso de tokens y tiempo de ejecución. Comparamos cómo cambia el rendimiento entre agentes, modelos y configuraciones de ejecución.
Para comparar modelos de lenguaje, consulta nuestros benchmarks de modelos.
Índice de agentes de programación de Artificial Analysis
Índice compuesto de 3 benchmarks:
- DeepSWESoftware engineering tasks, 113 tasks
- Terminal-Bench v2.1Agentic terminal use, 89 tasks
- SWE-Atlas-QnATechnical Q&A, 124 tasks
Cada puntaje de benchmark promedia pass@1 en tres intentos por tarea. El Índice otorga el mismo peso a sus 3 componentes de benchmark. Consulta la metodología para ver los detalles de puntuación y el historial de versiones.
Destacados
Rendimiento
Rendimiento en el Índice de agentes de programación de Artificial Analysis.
Índice de agentes de programación de Artificial Analysis
Comparación de harness
Índice de agentes de programación de Artificial Analysis por harness para Claude Opus 4.7.
Comparación de harness: Índice de agentes de programación de Artificial Analysis
Uso de tokens
Consumo de tokens en el Índice de agentes de programación de Artificial Analysis, incluyendo uso total, distribución de tokens, eficiencia y desgloses por benchmark.
Uso de tokens por tarea
Índice de agentes de programación de Artificial Analysis vs. tokens totales
Costo
Costo en el Índice de agentes de programación de Artificial Analysis según los precios actuales de la API por token, incluyendo el precio de escritura de caché y los descuentos de caché cuando están disponibles. Muchos usuarios accederán a los harness de agentes de programación mediante planes de suscripción en lugar de pago por token.
Costo por tarea
Índice de agentes de programación de Artificial Analysis vs. costo por tarea
Tiempo de ejecución
Tiempo de ejecución activo del agente en el Índice de agentes de programación de Artificial Analysis.
Tiempo por tarea
Índice de agentes de programación de Artificial Analysis vs. tiempo de ejecución
Preguntas frecuentes
El Índice de agentes de programación de Artificial Analysis es nuestro puntaje compuesto del rendimiento de los agentes de programación en el conjunto de benchmarks públicos de esta página. Combina DeepSWE, Terminal-Bench v2.1 y SWE-Atlas-QnA para capturar en una sola métrica principal la implementación, el flujo de trabajo en terminal, la comprensión de repositorios y el rendimiento más amplio en ingeniería de software.
El índice público actual incluye DeepSWE, Terminal-Bench v2.1 y SWE-Atlas-QnA. Estos benchmarks se combinan porque ponen a prueba distintas partes del flujo de trabajo del agente de programación en lugar de repetir el mismo formato de tarea.
El conjunto de benchmarks públicos combina varios estilos de tareas de ingeniería de software. Algunas son tareas de preguntas y respuestas y de comprensión de repositorios, centradas en leer una base de código, entender su arquitectura o comportamiento y producir una respuesta técnica correcta. Otras son tareas de implementación y corrección de errores que requieren cambios de código y se acercan al planteamiento clásico de hacer un parche que funcione. Otras son tareas de flujo de trabajo en terminal que evalúan si el agente puede desenvolverse en un entorno basado en shell, ejecutar herramientas correctamente y completar un flujo de trabajo de línea de comandos de varios pasos. Los tres benchmarks actuales usan resultados de tarea binarios.
Las tareas tipo preguntas y respuestas enfatizan la comprensión del repositorio, la lectura de código, el rastreo del comportamiento y la producción de una explicación técnica correcta. Las tareas tipo implementación se acercan más a entregar un cambio funcional: el agente tiene que entender la tarea, desenvolverse en el repositorio, editar archivos correctamente y satisfacer un evaluador o un resultado basado en pruebas bajo restricciones de ejecución. Son capacidades relacionadas, pero no idénticas. Un agente puede ser fuerte en el razonamiento sobre repositorios y aun así ser más débil en la ejecución confiable de parches, o viceversa, lo cual es una razón por la que el índice compuesto debe interpretarse junto con el gráfico por benchmark.
La página del benchmark reporta el promedio de pass@1 normalizado por tarea. Para cada benchmark, primero promediamos los tres intentos evaluados de cada tarea y luego promediamos esos puntajes por tarea para que cada tarea tenga el mismo peso. Todos los resultados de los componentes actuales son binarios. Un intento puede completarse sin errores y aun así obtener cero cuando no satisface su verificador. La puntuación binaria de aprobado/reprobado de SWE-Atlas-QnA está alineada con la metodología Task Resolve Rate de Scale AI.
El índice se calcula a partir de DeepSWE, Terminal-Bench v2.1 y SWE-Atlas-QnA. Para el Índice de agentes de programación de Artificial Analysis actual, la metodología pública es un promedio simple de esos puntajes de benchmark. La metodología de los benchmarks puede evolucionar a medida que mejora la cobertura, por lo que la comparabilidad se interpreta mejor dentro del conjunto de benchmarks publicado y su conjunto de componentes actual, en lugar de como un puntaje absoluto atemporal.
El tiempo de ejecución en esta página se refiere al tiempo transcurrido promedio por tarea, no solo a la latencia del modelo. Busca reflejar el costo de tiempo, desde la perspectiva del usuario, de ejecutar todo el flujo de trabajo del agente. Eso incluye el tiempo dedicado a razonar, emitir llamadas a herramientas, leer y escribir archivos, ejecutar pasos de shell y esperar las respuestas del modelo. Así, un agente puede tener un modelo subyacente rápido y aun así ser más lento en general si su flujo de trabajo es más largo o depende más de herramientas.
El uso de tokens es el consumo promedio observado de tokens por tarea en el conjunto de benchmarks. En esta página lo desglosamos en tokens de entrada, caché y salida. Los tokens de entrada son los que se envían al modelo, incluyendo prompts, instrucciones, contexto de herramientas y contexto de la tarea. Los tokens de caché son tokens de prompt reutilizados mediante caché de prompts cuando el proveedor expone esa telemetría. Los tokens de salida son los que genera el modelo en su respuesta. El uso de tokens importa porque a menudo determina el costo y también puede indicar cuánto contexto consume un agente para realizar el trabajo, pero la eficiencia de tokens y el costo no son idénticos porque los proveedores fijan precios distintos para cada categoría de tokens y la caché puede cambiar significativamente la factura.
Un puntaje de índice más alto significa un mejor rendimiento en la mezcla de benchmarks incluida, pero no significa que el agente sea el mejor para todos los flujos de trabajo. El índice es un equilibrio entre la calidad de los benchmarks, no una medida directa de tus prioridades específicas de latencia, costo, herramientas o tipo de tarea. La elección en el mundo real todavía depende de si tu flujo de trabajo se parece más a preguntas y respuestas sobre repositorios, aplicación de parches o ejecución en terminal, y de restricciones prácticas como la integración con el IDE, la disponibilidad del modelo y la confiabilidad.
Estos benchmarks miden el rendimiento de los agentes de programación en repositorios, herramientas, flujos de trabajo de varios pasos y resultados basados en evaluadores. Los resultados de esta página reflejan variantes específicas de agentes evaluadas, no solo nombres genéricos de productos: la elección del modelo, la configuración y los ajustes de ejecución pueden cambiar significativamente los resultados, razón por la cual una misma familia de agentes puede aparecer en varias variantes en los resultados. Para más información sobre las ejecuciones de benchmarks, la puntuación por tarea y la metodología, consulta la página de metodología de benchmarking de agentes de programación. Ver la metodología de benchmarking de agentes de programación