Comparação de modelos: análise de inteligência, desempenho e preço
ExperimenteInteligência
UpdatedInteligênciaUpdated
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index: pesos abertos vs. proprietários
Mede o desempenho dos modelos em capacidades e setores específicos
Artificial Analysis Índice de Finanças e Contabilidade
Intelligence Evaluations
Agentic knowledge work, (Elo-500)/2000
Agentic real-world work tasks, (Elo-500)/2000
Agentic SaaS workflows
Agentic coding & terminal use
Coding
Reasoning & knowledge
Professional document reasoning, All-pass
Physics reasoning
Knowledge
1 - hallucination rate
Long context reasoning
Legal agentic work, criterion pass rate
Agentic business operations
Agentic scientific research workflows in a terminal
Quantitative analysis on spreadsheets & documents
Kubernetes incident root-cause analysis
Visual reasoning
Medical long context reasoning
AA-Briefcase v1.1Updated
Elo do AA-Briefcase
AA-Omniscience
AA-Omniscience Index
Openness Index
Artificial Analysis Openness Index: pontuação
Comparações do Intelligence Index
Intelligence Index vs. custo por tarefa do Intelligence Index
Uso de tokens
Tokens de saída por tarefa do Índice de Inteligência
Custo
Custo por tarefa do Intelligence Index
Custo de executar o Artificial Analysis Intelligence Index
Preços: acertos de cache, entrada e saída
Janela de contexto
Janela de contexto
Velocidade
Medida pela velocidade de saída (tokens por segundo)
Velocidade de saída
Tempo por tarefa do Índice de Inteligência
Latência
Medida pelo tempo (segundos) até o primeiro token
Latência: Tempo até o primeiro token da resposta final
Tempo de resposta de ponta a ponta
Seconds to output 500 tokens, calculated based on time to first token, 'thinking' time for reasoning models, and output speed
Tempo de resposta de ponta a ponta
Tamanho do modelo (somente modelos de pesos abertos)
Tamanho do modelo: parâmetros totais e ativos
Perguntas frequentes
Atualmente, Claude Opus 5.5 (Max, Default Fallback) lidera o Artificial Analysis Intelligence Index com 58 pontos, entre 199 modelos avaliados.
Os melhores modelos de IA segundo o Intelligence Index são: 1. Claude Opus 5.5 (Max, Default Fallback) (58), 2. Claude Sonnet 5.5 (Max, Default Fallback) (56), 3. Claude Opus 5.5 (Xhigh, Default Fallback) (56), 4. Claude Opus 5.5 (High, Default Fallback) (54) e 5. Claude Fable 5.1 (Max, Default Fallback) (53).
Celeris-1 é o mais rápido, com 1,574.5 tokens por segundo, seguido por Mercury 2.5 (691.1 t/s) e Mercury 2 (682.4 t/s).
Llama 3.1 Instruct 8B é o mais acessível, com um preço combinado de $0.02 por 1M de tokens, seguido por Granite 4.2 3B ($0.02) e Nova Micro ($0.03).
Gemini 2.5 Flash-Lite (Non-reasoning) tem o menor tempo até o primeiro token, de 0.30s, seguido por Nemotron 3 Nano Omni 30B A3B Reasoning (0.36s) e North Mini Code (0.44s).
MiMo-V2.6-Pro é o modelo de pesos abertos mais bem classificado, com 46 pontos no Intelligence Index. Há 81 modelos de pesos abertos entre 199 modelos avaliados no total.
Os melhores modelos de IA de pesos abertos segundo o Intelligence Index são: 1. MiMo-V2.6-Pro (46), 2. GLM-5.3 (Max) (45) e 3. Kimi K3 (Max) (44).
Claude Opus 5.5 (Max, Default Fallback) lidera entre 177 modelos de raciocínio, com 58 pontos no Intelligence Index. Os modelos de raciocínio usam um processo de reflexão prolongado para resolver problemas complexos antes de responder.
Os modelos são comparados em várias dimensões, incluindo inteligência (qualidade), preço, velocidade de saída (tokens por segundo), latência (tempo até o primeiro token), tempo de resposta de ponta a ponta e tamanho da janela de contexto. As métricas de desempenho são medidas diretamente com prompts padronizados em 691 modelos.
Clique no nome ou na linha de qualquer modelo nos gráficos para acessar sua página exclusiva, com métricas detalhadas e comparações diretas com modelos semelhantes. Você também pode usar o seletor de modelos para personalizar quais deles aparecem em cada gráfico. Ver o ranking