Caché de prompts: análisis de costo y rendimiento entre proveedores
La caché de prompts puede reducir el costo de los tokens de entrada hasta un 90% y hace viables las cargas de trabajo de contexto largo. Compara precios de caché, descuentos y especificaciones de API de los principales proveedores de IA.
La caché exige coincidencias exactas del prompt y varía según el proveedor: algunos como OpenAI y DeepSeek ofrecen caché automática, mientras que otros, incluidos Google, Anthropic y Amazon, requieren configuración manual. Más detalles sobre cómo funciona en nuestra introducción a la caché de prompts más abajo.
Precios
Precios: acierto de caché, escritura de caché, entrada y salida
Descuento de caché
Pricing: Cache Discount
Especificaciones de API de caché de prompts
Proveedor | Modelo | Entrada (estándar) | Escritura de caché | Acierto de caché | Almacenamiento de caché | Salida (estándar) | Activado automáticamente | Mín. tokens | TTL de caché | Notas |
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | - | $25.00 | - | - | ||
GPT-5.5 (xhigh) | $5.50 | - | $0.55 | - | $33.00 | - | - | |||
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | $10.00 | $12.50 | $1.00 | $20.00 | $50.00 | - | - | ||
Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | $10.00 | $25.00 | - | - | 1h cache write: $10 | ||
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | $10.00 | $12.50 | $1.00 | - | $50.00 | - | - | ||
Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | - | $25.00 | - | - | |||
| GPT-5.5 (xhigh) | $5.00 | - | $0.50 | - | $30.00 | 1024 | 5-10 minutes
| ||
GPT-5.4 mini (xhigh) | $0.75 | - | $0.07 | - | $4.50 | - | - | |||
| Grok 4.3 (high) | $1.25 | $1.25 | $0.20 | - | $2.50 | - | - | For requests greater than 200k tokens, pricing is $2.50 per 1M input tokens, $0.40 per 1M cached input tokens, and $5.00 per 1M output tokens | |
Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - | |||
| Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - | ||
Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - | |||
Kimi K2.6 | $0.75 | - | $0.16 | - | $3.50 | - | - | |||
OpenAI models:
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | $2.00 | $2.50 | $0.20 | - | $10.00 | - | - | ||
GPT-5.4 mini (xhigh) | $0.75 | - | $0.07 | - | $4.50 | - | - | |||
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $0.43 | - | $0.00 | - | $0.87 | - | - | ||
Kimi K2.6 | $0.65 | - | $0.15 | - | $3.41 | - | - | |||
Kimi K2.6 | $0.70 | - | $0.35 | - | $3.50 | - | - | |||
| Kimi K2.6 | $0.75 | - | $0.15 | - | $3.50 | - | - | ||
Kimi K2.6 | $0.85 | - | $0.14 | - | $3.60 | - | - | |||
Kimi K2.6 | $0.80 | - | $0.16 | - | $3.40 | - | - | |||
Kimi K2.6 | $0.77 | - | $0.14 | - | $3.40 | - | - | |||
| Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - |
Introducción a la caché de prompts
¿Qué es la caché de prompts?
La caché de prompts permite que la inferencia de un modelo de lenguaje reutilice tokens de entrada ya procesados, reduciendo su costo hasta un 90% y haciendo viables las cargas de trabajo de contexto largo. Acertar con la estrategia de caché puede generar grandes ahorros en tokens de entrada y beneficios claros de rendimiento.
Cuando envías un prompt, el sistema primero comprueba si ese prompt exacto ya se procesó. Si se encuentra (acierto de caché), devuelve la respuesta almacenada en lugar de generar una nueva. Si no se encuentra (fallo de caché), el prompt se procesa con normalidad y la respuesta se guarda para usos futuros.
Métricas clave a seguir
- Precio de entrada: El precio estándar que pagas por los tokens de entrada
- Precio de escritura de caché: Lo que pagas por guardar tokens del prompt en la caché; a veces es más alto que el precio estándar de entrada
- Precio de acierto de caché: Tarifa con descuento para los tokens del prompt que aciertan en la caché
- Precio de almacenamiento de caché: Costo por hora por millón de tokens en caché (por ahora exclusivo de Google)
- TTL de caché: El tiempo que los tokens en caché siguen disponibles, de horas a días
- Mínimo de tokens de caché: Cantidad mínima de tokens coincidentes necesaria para servir un acierto de caché
¿Cómo funciona la caché de prompts?
Cuando envías un prompt a un modelo de lenguaje basado en transformers, las capas de atención procesan cada token de entrada en vectores de clave (K) y valor (V) que se almacenan en la caché KV. Al mantener estos valores en memoria, se puede evitar volver a procesar los tokens de entrada cuando se envían de nuevo tokens idénticos al modelo.
Hasta hace poco, aprovechar los beneficios de velocidad y costo de la caché solo era posible en despliegues dedicados. Ahora, los proveedores de API serverless —incluidos los laboratorios frontier— han empezado a trasladar parte de esos beneficios de costo a los desarrolladores.
Casos de uso óptimos
- Instrucciones de sistema: Prompts de sistema extensos que deben incluirse en muchas interacciones
- Historial de chat: El contexto de la conversación que acompaña cada nuevo turno del usuario
- Contexto personalizado por usuario: Memorias o perfiles extensos que permiten una personalización profunda
Consideraciones de implementación
- El método de activación varía según el proveedor: algunos requieren configuración manual y otros ofrecen caché automática
- Los descuentos por acierto de caché van del 50% al 90% sobre el precio estándar de tokens de entrada: vale la pena invertir el tiempo en hacerlo bien
- La caché mejora el rendimiento en prompts muy largos (más de 50k tokens)