Análisis independiente de IA
Entiende el panorama de la IA para elegir el mejor modelo y proveedor para tu caso de uso
Optima
Crea benchmarks personalizados a partir de tus propias tareas para encontrar el modelo adecuado para tu caso de uso
Índice de inteligencia v4.1.1
El índice de inteligencia v4.1.1 actualiza 𝜏³-Banking a la versión 1.0.1 y mejora el modelo evaluador de HLE, AA-LCR y AA-Omniscience a GPT-5.6 Luna (medium)
Destacados
Inteligencia
Inteligencia de los principales modelos de IA según nuestras evaluaciones independientes
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index by Open Weights / Proprietary
Cost per Intelligence Index Task
Intelligence Index vs. Cost per Intelligence Index Task
Inteligencia de modelos de lenguaje de frontera a lo largo del tiempo
Rendimiento, costo y tiempo de ejecución de los principales agentes de programación en tareas integrales de ingeniería de software
Índice de agentes de programación de Artificial Analysis
Imagen y video
Mejores modelos de nuestros rankings Image Arena y Video Arena, con intervalos de confianza del 95%
Ranking de texto a imagen
Voz
Mejores modelos de nuestras evaluaciones Text to Speech Arena, Speech to Text y Speech to Speech
Text to Speech Arena Leaderboard
Miden el rendimiento de modelos en capacidades e industrias específicas
Artificial Analysis Agentic Index
Intelligence Evaluations
Agentic real-world work tasks, (Elo-500)/2000
Agentic tool use
Agentic coding & terminal use
Coding
Reasoning & knowledge
Scientific reasoning
Physics reasoning
Knowledge
1 - hallucination rate
Long context reasoning
Agentic knowledge work, Elo
Agentic SaaS workflows
Legal agentic work, criterion pass rate
Agentic business operations
Quantitative analysis on spreadsheets & documents
Instruction following
Long-horizon agentic tasks
Kubernetes incident root-cause analysis
Visual reasoning
AA-Briefcase
AA-Briefcase es una evaluación agéntica de vanguardia para trabajo cognitivo de largo plazo, que prueba agentes en flujos de trabajo empresariales realistas que requieren entregables como hojas de cálculo, presentaciones y memorandos
AA-Briefcase Elo
AA-AnalystAgent
AA-AnalystAgent es un benchmark de análisis cuantitativo de extremo a extremo sobre hojas de cálculo y documentos reales: el tipo de trabajo que los analistas de negocio y de datos realizan a diario
AA-AnalystAgent pass^5
AA-Omniscience
AA-Omniscience es un benchmark de conocimiento y alucinaciones que premia la precisión, penaliza las respuestas incorrectas y ofrece una vista completa de qué modelos producen resultados fiables en distintos dominios
Índice AA-Omniscience
GDPval-AA v2
GDPval-AA v2 evalúa modelos de IA en tareas reales de valor económico en una amplia gama de ocupaciones
GDPval-AA v2 Leaderboard
El índice de apertura de Artificial Analysis evalúa qué tan 'abiertos' son los modelos según su disponibilidad y transparencia en distintos componentes.
Artificial Analysis Openness Index: Components
Artificial Analysis Openness Index vs. Artificial Analysis Intelligence Index
Tokens de salida
Tokens de salida de los principales modelos de IA según nuestras evaluaciones independientes
Output Tokens per Intelligence Index Task
Costo
Precios y costos reales de los principales modelos de IA según nuestras evaluaciones independientes
Cost per Intelligence Index Task
Cost to Run Artificial Analysis Intelligence Index
Pricing: Cache Hit, Input, and Output
Velocidad y latencia
Comparación del rendimiento de API de primera parte