Artificial Analysis 코딩 에이전트 벤치마크

소프트웨어 엔지니어링 작업에서 코딩 에이전트의 실제 성능을 비용, 토큰 사용량, 실행 시간을 포함해 측정합니다. 에이전트, 모델, 실행 설정에 따라 성능이 어떻게 달라지는지 비교합니다.

언어 모델을 비교하려면 모델 벤치마크를 확인하세요.

Artificial Analysis Coding Agent Index

3개 벤치마크의 복합 지수:

각 벤치마크 점수는 작업당 3회 시도의 pass@1을 평균한 값입니다. 지수는 3개의 벤치마크 구성 요소에 동일한 가중치를 부여합니다. 채점 세부 사항과 버전 이력은 방법론을 참조하세요.

하이라이트

Updated
Artificial Analysis Coding Agent Index v1.5 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

성능Updated

Artificial Analysis Coding Agent Index 전반의 성능.

Artificial Analysis Coding Agent Index

Artificial Analysis Coding Agent Index v1.5 incorporates 3 benchmarks: DeepSWE v1.1, Terminal-Bench 4.0, and SWE-Atlas-QnA · Higher is better

Artificial Analysis Coding Agent Index vs. 작업당 비용

Artificial Analysis Coding Agent Index vs. 작업당 평균 토큰당 종량제 API 비용 (USD)
Most attractive quadrant
Pareto line

하네스 비교

곧 공개 예정

토큰 사용량

Artificial Analysis Coding Agent Index 전반의 토큰 소비량으로, 총 사용량, 토큰 구성, 효율성, 벤치마크별 분석을 포함합니다.

작업당 토큰 사용량

작업당 평균 입력·캐시·출력 토큰
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.

Artificial Analysis Coding Agent Index vs. 총 토큰

Artificial Analysis Coding Agent Index vs. 작업당 평균 총 토큰
Most attractive quadrant

비용

현재 토큰당 API 요금을 기준으로 한 Artificial Analysis Coding Agent Index의 비용으로, 가능한 경우 캐시 쓰기 요금과 캐시 할인을 포함합니다. 많은 사용자는 토큰당 종량제가 아니라 구독 요금제를 통해 코딩 에이전트 하네스를 이용합니다.

작업당 비용

Average pay-per-token API cost per task (USD) · Lower is better

실행 시간

Artificial Analysis Coding Agent Index 전반의 활성 에이전트 실행 시간.

작업당 시간

Average agent wall time per task · Lower is better

Artificial Analysis Coding Agent Index vs. 실행 시간

Artificial Analysis Coding Agent Index vs. 작업당 평균 에이전트 실행 시간
Most attractive quadrant

자주 묻는 질문