모델 비교: 지능, 성능 및 가격 분석
사용해 보기지능
Updated지능Updated
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index: 오픈 웨이트와 독점 모델
특정 역량 및 산업에서 모델의 성능을 측정
Artificial Analysis 재무 및 회계 지수
Intelligence Evaluations
Agentic knowledge work, (Elo-500)/2000
Agentic real-world work tasks, (Elo-500)/2000
Agentic SaaS workflows
Agentic coding & terminal use
Coding
Reasoning & knowledge
Professional document reasoning, All-pass
Physics reasoning
Knowledge
1 - hallucination rate
Long context reasoning
Legal agentic work, criterion pass rate
Agentic business operations
Agentic scientific research workflows in a terminal
Quantitative analysis on spreadsheets & documents
Kubernetes incident root-cause analysis
Visual reasoning
Medical long context reasoning
AA-Briefcase v1.1Updated
AA-Briefcase Elo
AA-Omniscience
AA-Omniscience Index
Openness Index
Artificial Analysis Openness Index: 점수
Intelligence Index 비교
Intelligence Index와 작업당 비용
토큰 사용량
지능 지수 작업당 출력 토큰 수
비용
Intelligence Index 작업당 비용
Artificial Analysis Intelligence Index 실행 비용
가격: 캐시 적중, 입력 및 출력
컨텍스트 창
컨텍스트 창
속도
출력 속도(초당 토큰 수)로 측정
출력 속도
지능 지수 작업당 시간
지연 시간
첫 토큰까지 걸린 시간(초)으로 측정
지연 시간: 첫 답변 토큰까지 걸린 시간
종단 간 응답 시간
Seconds to output 500 tokens, calculated based on time to first token, 'thinking' time for reasoning models, and output speed
종단 간 응답 시간
모델 크기(오픈 웨이트 모델만 해당)
모델 크기: 총 매개변수와 활성 매개변수
자주 묻는 질문
Claude Opus 5.5 (Max, Default Fallback)은 Artificial Analysis Intelligence Index에서 58점으로, 평가된 모델 197개 중 선두입니다.
Intelligence Index 기준 상위 AI 모델: 1. Claude Opus 5.5 (Max, Default Fallback)(58), 2. Claude Sonnet 5.5 (Max, Default Fallback)(56), 3. Claude Opus 5.5 (Xhigh, Default Fallback)(56), 4. Claude Opus 5.5 (High, Default Fallback)(54) 및 5. Claude Fable 5.1 (Max, Default Fallback)(53).
Celeris-1이 초당 1,656.6토큰으로 가장 빠르며, Mercury 2(739.3 t/s)과 Mercury 2.5(620.7 t/s)이 뒤를 잇습니다.
Llama 3.1 Instruct 8B이 혼합 가격 기준 토큰 100만 개당 $0.02로 가장 저렴하며, Granite 4.2 3B($0.02)과 Nova Micro($0.03)이 뒤를 잇습니다.
Gemini 2.5 Flash-Lite (Non-reasoning)의 첫 토큰까지 걸린 시간이 0.32초로 가장 짧으며, Nemotron 3 Nano Omni 30B A3B Reasoning(0.35초)과 North Mini Code(0.42초)이 뒤를 잇습니다.
MiMo-V2.6-Pro이 Intelligence Index 점수 46점으로 가장 높은 순위의 오픈 웨이트 모델입니다. 평가한 전체 모델 197개 중 오픈 웨이트 모델은 81개입니다.
Intelligence Index 기준 상위 오픈 웨이트 AI 모델: 1. MiMo-V2.6-Pro(46), 2. GLM-5.3 (Max)(45) 및 3. Kimi K3 (Max)(44).
Claude Opus 5.5 (Max, Default Fallback)이 Intelligence Index 점수 58점으로 추론 모델 175개 중 선두입니다. 추론 모델은 답변하기 전에 확장 사고를 사용해 복잡한 문제를 해결합니다.
지능(품질), 가격, 출력 속도(초당 토큰 수), 지연 시간(첫 토큰까지 걸린 시간), 종단 간 응답 시간, 컨텍스트 창 크기 등 여러 차원에서 모델을 비교합니다. 표준화된 프롬프트를 사용해 모델 690개의 성능 지표를 직접 측정합니다.
차트에서 모델 이름이나 행을 클릭하면 상세 지표와 비슷한 모델과의 직접 비교가 있는 전용 페이지를 볼 수 있습니다. 모델 선택기를 사용해 각 차트에 표시할 모델을 직접 정할 수도 있습니다. 리더보드 보기