Artificial Analysis 코딩 에이전트 벤치마크
소프트웨어 엔지니어링 작업에서 코딩 에이전트의 실제 성능을 비용, 토큰 사용량, 실행 시간을 포함해 측정합니다. 에이전트, 모델, 실행 설정에 따라 성능이 어떻게 달라지는지 비교합니다.
언어 모델을 비교하려면 모델 벤치마크를 확인하세요.
Artificial Analysis Coding Agent Index
3개 벤치마크의 복합 지수:
- DeepSWESoftware engineering tasks, 113 tasks
- Terminal-Bench v2.1Agentic terminal use, 89 tasks
- SWE-Atlas-QnATechnical Q&A, 124 tasks
각 벤치마크 점수는 작업당 3회 시도의 pass@1을 평균한 값입니다. 지수는 3개의 벤치마크 구성 요소에 동일한 가중치를 부여합니다. 채점 세부 사항과 버전 이력은 방법론을 참조하세요.
하이라이트
성능
Artificial Analysis Coding Agent Index 전반의 성능.
Artificial Analysis Coding Agent Index
하네스 비교
Claude Opus 4.7의 하네스별 Artificial Analysis Coding Agent Index.
하네스 비교: Artificial Analysis Coding Agent Index
토큰 사용량
Artificial Analysis Coding Agent Index 전반의 토큰 소비량으로, 총 사용량, 토큰 구성, 효율성, 벤치마크별 분석을 포함합니다.
작업당 토큰 사용량
Artificial Analysis Coding Agent Index vs. 총 토큰
비용
현재 토큰당 API 요금을 기준으로 한 Artificial Analysis Coding Agent Index의 비용으로, 가능한 경우 캐시 쓰기 요금과 캐시 할인을 포함합니다. 많은 사용자는 토큰당 종량제가 아니라 구독 요금제를 통해 코딩 에이전트 하네스를 이용합니다.
작업당 비용
Artificial Analysis Coding Agent Index vs. 작업당 비용
실행 시간
Artificial Analysis Coding Agent Index 전반의 활성 에이전트 실행 시간.
작업당 시간
Artificial Analysis Coding Agent Index vs. 실행 시간
자주 묻는 질문
Artificial Analysis Coding Agent Index는 이 페이지의 공개 벤치마크 스위트 전반에 걸친 코딩 에이전트 성능의 복합 점수입니다. 구현, 터미널 워크플로, 리포지토리 이해, 그리고 더 넓은 소프트웨어 엔지니어링 성능을 하나의 대표 지표로 담기 위해 다음을 결합합니다: DeepSWE, Terminal-Bench v2.1 및 SWE-Atlas-QnA.
현재 공개 지수에는 다음이 포함됩니다: DeepSWE, Terminal-Bench v2.1 및 SWE-Atlas-QnA. 이 벤치마크들은 동일한 작업 형식을 반복하는 대신 코딩 에이전트 워크플로의 서로 다른 부분을 부하 테스트하기 때문에 결합됩니다.
공개 벤치마크 스위트는 여러 소프트웨어 엔지니어링 작업 스타일을 혼합합니다. 일부는 코드베이스를 읽고 아키텍처나 동작을 이해하며 올바른 기술적 답변을 도출하는 데 초점을 둔 Q&A 및 리포지토리 이해 작업입니다. 일부는 코드 변경이 필요하며 작동하는 패치를 만드는 고전적 방식에 더 가까운 구현 및 버그 수정 작업입니다. 일부는 에이전트가 셸 기반 환경을 탐색하고 도구를 올바르게 실행하며 여러 단계의 명령줄 워크플로를 완료할 수 있는지 테스트하는 터미널 워크플로 작업입니다. 현재 세 가지 벤치마크는 모두 이진 작업 결과를 사용합니다.
Q&A 방식 작업은 리포지토리 이해, 코드 읽기, 동작 추적, 올바른 기술적 설명 작성을 강조합니다. 구현 방식 작업은 작동하는 변경을 제공하는 것에 더 가깝습니다. 에이전트는 작업을 이해하고 리포지토리를 탐색하며 파일을 올바르게 편집하고 실행 제약 하에서 평가자 또는 테스트 기반 결과를 충족해야 합니다. 이는 관련된 역량이지만 동일하지는 않습니다. 에이전트는 리포지토리 추론에 강하면서도 신뢰할 수 있는 패치 실행에는 약할 수 있으며 그 반대의 경우도 있습니다. 이것이 복합 지수를 벤치마크별 차트와 함께 해석해야 하는 이유 중 하나입니다.
벤치마크 페이지는 작업 정규화된 평균 pass@1을 보고합니다. 각 벤치마크에 대해 먼저 각 작업의 세 번의 평가된 시도를 평균한 다음, 모든 작업이 동일한 가중치를 갖도록 그 작업 수준 점수를 평균합니다. 현재의 모든 구성 요소 결과는 이진입니다. 시도가 문제없이 완료되어도 검증자를 충족하지 못하면 0점을 받을 수 있습니다. SWE-Atlas-QnA의 이진 합격/불합격 채점은 Scale AI의 Task Resolve Rate 방법론과 일치합니다.
지수는 DeepSWE, Terminal-Bench v2.1 및 SWE-Atlas-QnA에서 계산됩니다. 현재 Artificial Analysis Coding Agent Index의 경우, 공개된 방법론은 해당 벤치마크 점수들의 단순 평균입니다. 벤치마크 방법론은 커버리지가 향상됨에 따라 발전할 수 있으므로, 비교 가능성은 시대를 초월한 절대 점수가 아니라 공개된 벤치마크 스위트와 현재의 구성 요소 집합 내에서 해석하는 것이 가장 좋습니다.
이 페이지의 실행 시간은 단순한 모델 지연 시간이 아니라 작업당 평균 실제 소요 런타임을 의미합니다. 전체 에이전트 워크플로를 실행하는 데 드는, 사용자가 체감하는 시간 비용을 반영하기 위한 것입니다. 여기에는 추론, 도구 호출 발행, 파일 읽기와 쓰기, 셸 단계 실행, 모델 응답 대기에 소요되는 시간이 포함됩니다. 따라서 에이전트는 빠른 기반 모델을 갖추고도 워크플로가 더 길거나 도구를 더 많이 사용하면 전체적으로 더 느릴 수 있습니다.
토큰 사용량은 벤치마크 스위트 전반에 걸친 작업당 평균 관측 토큰 소비량입니다. 이 페이지에서는 이를 입력, 캐시, 출력 토큰으로 나눕니다. 입력 토큰은 프롬프트, 지시, 도구 컨텍스트, 작업 컨텍스트를 포함해 모델로 전송되는 토큰입니다. 캐시 토큰은 제공업체가 해당 텔레메트리를 노출하는 경우 프롬프트 캐싱을 통해 재사용되는 프롬프트 토큰입니다. 출력 토큰은 모델이 응답에서 생성하는 토큰입니다. 토큰 사용량은 종종 비용을 좌우하고 에이전트가 작업을 수행하기 위해 소비하는 컨텍스트의 양을 나타낼 수도 있으므로 중요하지만, 제공업체가 토큰 범주별로 다르게 가격을 책정하고 캐싱이 청구액을 크게 바꿀 수 있기 때문에 토큰 효율성과 비용은 동일하지 않습니다.
지수 점수가 높을수록 포함된 벤치마크 조합 전반에서 더 강한 성능을 의미하지만, 그 에이전트가 모든 워크플로에 최적이라는 뜻은 아닙니다. 지수는 벤치마크 품질 전반의 균형이며, 지연 시간, 비용, 도구, 작업 유형에 대한 귀하의 구체적 우선순위를 직접 측정하는 것이 아닙니다. 실제 선택은 여전히 워크플로가 리포지토리 Q&A, 패치 적용, 터미널 실행 중 무엇에 더 가까운지, 그리고 IDE 통합, 모델 가용성, 신뢰성 같은 실무적 제약에 달려 있습니다.
이 벤치마크들은 리포지토리, 도구, 여러 단계의 워크플로, 평가자 기반 결과 전반에 걸친 코딩 에이전트 성능을 측정합니다. 이 페이지의 결과는 단순한 일반 제품명이 아니라 평가된 특정 에이전트 변형을 반영합니다. 모델 선택, 설정, 실행 구성이 결과를 크게 바꿀 수 있으며, 그렇기 때문에 하나의 에이전트 계열이 결과에서 여러 변형으로 나타날 수 있습니다. 벤치마크 실행, 작업 수준 채점, 방법론에 대한 자세한 배경은 코딩 에이전트 벤치마킹 방법론 페이지를 참조하세요. 코딩 에이전트 벤치마킹 방법론 보기