Grok 4.7: inteligencia, rendimiento y precio del lanzamiento
Resumen del modelo
Verbosidad
El lanzamiento Grok 4.7 ofrece 3 modelos, cada uno con distintas características de inteligencia, rendimiento y precio. A continuación se comparan las métricas clave de los 3 modelos.
- En inteligencia, el modelo líder de Grok 4.7 es Grok 4.7 (Xhigh), con 46.
- En velocidad de salida, el modelo más rápido es Grok 4.7 (Xhigh), con 81 tokens/s.
- En latencia, Grok 4.7 (Low), con 5,48 s ofrece el menor tiempo hasta el primer token de respuesta.
- En precio, Grok 4.7 (Low), con $1.25 ofrece el menor costo por tarea. Los precios varían hasta 3 veces entre modelos.
| Razonamiento | Sí Esta página muestra la versión con razonamiento de este modelo. También puede existir una variante sin razonamiento. |
|---|---|
| Modalidad de entrada | Admite: texto e imágenes |
| Modalidad de salida | Admite: texto |
| Ventana de contexto | 500k ~750 páginas A4 con fuente Arial de 12 puntos |
Las métricas se comparan con modelos de la misma clase:
- Modelos sin razonamiento → se comparan solo con otros modelos sin razonamiento
- Modelos de razonamiento → se comparan tanto con modelos de razonamiento como sin razonamiento
- Modelos de pesos abiertos → se comparan solo con otros modelos de pesos abiertos de la misma categoría de tamaño:
- Muy pequeño: ≤4B parámetros
- Pequeño: 4B–40B parámetros
- Mediano: 40B–150B parámetros
- Grande: >150B parámetros
- Modelos propietarios → se comparan con modelos propietarios y de pesos abiertos del mismo rango de precio mediante una proporción combinada de precios de entrada/salida de 3:1:
- <$0.15 por 1 M de tokens
- $0.15–$1 por 1 M de tokens
- >$1 por 1 M de tokens
Inteligencia
Artificial Analysis Intelligence Index
Intelligence Index vs. costo por tarea del Intelligence Index
Costo
Costo por tarea del Intelligence Index
Velocidad y latencia
Velocidad de salida
Puntuaciones de capacidades
Índices de capacidades
Incorporates 7 evaluations: AA-Omniscience, GDPval-AA v2.1, AA-Briefcase v1.1, Humanity's Last Exam, AutomationBench-AA, AA-LCR v1.1, GDP.pdf · Higher is better
Incorporates 6 evaluations: GDPval-AA v2.1, AA-Briefcase v1.1, AA-Omniscience, AutomationBench-AA, AA-LCR v1.1, GDP.pdf · Higher is better
Incorporates 7 evaluations: AA-Omniscience, GDPval-AA v2.1, AA-Briefcase v1.1, Humanity's Last Exam, AA-LCR v1.1, GDP.pdf, AutomationBench-AA · Higher is better
Incorporates 6 evaluations: AA-Omniscience, GDPval-AA v2.1, AA-Briefcase v1.1, MLCR-AA, Humanity's Last Exam, AutomationBench-AA · Higher is better
Incorporates 6 evaluations: AA-Omniscience, Humanity's Last Exam, CritPt, GDPval-AA v2.1, AA-Briefcase v1.1, Terminal-Bench 4.0 · Higher is better
Incorporates 5 evaluations: AA-Omniscience, Humanity's Last Exam, GDPval-AA v2.1, AA-Briefcase v1.1, AA-LCR v1.1 · Higher is better
Intelligence Evaluations
Agentic knowledge work, (Elo-500)/2000
Agentic real-world work tasks, (Elo-500)/2000
Agentic SaaS workflows
Agentic coding & terminal use
Coding
Reasoning & knowledge
Professional document reasoning, All-pass
Physics reasoning
Knowledge
1 - hallucination rate
Long context reasoning
Legal agentic work, Hallucination-Gated All-Pass Rate
Kubernetes incident root-cause analysis
Visual reasoning
Medical long context reasoning
Más detalles
Pesos | Benchmarks de proveedores | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Grok 4.7 (Xhigh) | 46 | - | 500k | 1,4 US$ | 81 | No disponible | |||
| Grok 4.7 (High) | 46 | - | 500k | 1,4 US$ | 73 | No disponible | |||
| Grok 4.7 (Low) | 42 | - | 500k | 1,4 US$ | 72 | No disponible |