Caché de prompts: análisis de costo y rendimiento entre proveedores

La caché de prompts puede reducir el costo de los tokens de entrada hasta un 90% y hace viables las cargas de trabajo de contexto largo. Compara precios de caché, descuentos y especificaciones de API de los principales proveedores de IA.

La caché exige coincidencias exactas del prompt y varía según el proveedor: algunos como OpenAI y DeepSeek ofrecen caché automática, mientras que otros, incluidos Google, Anthropic y Amazon, requieren configuración manual. Más detalles sobre cómo funciona en nuestra introducción a la caché de prompts más abajo.

Precios

Precios: acierto de caché, escritura de caché, entrada y salida

Price (USD per M Tokens)

Descuento de caché

Pricing: Cache Discount

1 - (cache hit price / input price) · Higher is better

Especificaciones de API de caché de prompts

Proveedor
Modelo
Entrada (estándar)
Escritura de caché
Acierto de caché
Almacenamiento de caché
Salida (estándar)
Activado automáticamente
Mín. tokens
TTL de caché
Notas
AnthropicAnthropic
  • Cache read tokens are 90% cheaper than base input tokens
  • Cache write tokens are 25% more expensive than base input tokens
Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)
$4.00
$5.00
$0.20
-
$20.00
-
-
-
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
$10.00
$12.50
$0.25
$20.00
$50.00
-
-
Amazon BedrockAmazon Bedrock
  • Amazon supports caching for Nova models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
GPT-6 Astra (max)
$10.00
$12.50
$1.00
-
$50.00
-
-

30min cache write

Claude Opus 5 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
OpenAIOpenAI
  • Cache read tokens are 50% cheaper than base input tokens
  • Cache persists up to one hour during off-peak periods
GPT-6 Astra (max)
$10.00
$12.50
$1.00
-
$50.00
-
-
-
GPT-6 Sol (max)
$2.00
$2.50
$0.20
-
$10.00
-
-
-
GoogleGoogle
  • Google supports caching for Gemini models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Opus 5 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
Gemini 3.8 Flash (high)
$0.75
$0.75
$0.07
-
$3.75
-
-
MetaMeta
Muse Spark 1.3 (max)
$1.25
-
$0.15
-
$4.25
-
-
Microsoft AzureMicrosoft Azure

OpenAI models:

  • Cache read tokens are 50% cheaper than base input tokens (Standard deployments)
  • Cache persists up to one hour during off-peak periods
GPT-5.6 Sol (max)
$4.00
-
$0.40
-
$20.00
-
-
SpaceXAISpaceXAI
  • Prompt caching is not 100% guaranteed.
Grok 4.7 (xhigh)
$2.00
-
$0.50
-
$6.00
-
-
Grok 4.6 (high)
$2.00
-
$0.50
-
$6.00
-
-
MiMo-V2.6-Pro
$0.43
-
$0.00
-
$0.87
-
-
Alibaba CloudAlibaba Cloud
  • Alibaba offers two cache types: implicit and explicit.
  • Implicit cache is automatically enabled. It is billed at 20% of the standard input token price.
  • Explicit cache must be activated. It creates a cache for specific content to ensure a deterministic hit within its 5-minute validity period. Tokens used to create the cache are billed at 125% of the standard input token price, while subsequent cache hits are billed at 10% of that price.
Qwen3.8 Max (0902)
$2.00
-
$0.25
-
$6.00
-
-
Qwen3.8 27B (xhigh)
$0.50
-
$0.05
-
$3.00
-
-
GLM-5.3 (max)
$1.40
-
$0.14
-
$4.40
-
-
GLM-5.3 (max)
$2.10
-
$0.21
-
$6.60
-
-
Bitdeer AIBitdeer AI
GLM-5.3 (max)
$1.40
-
$0.14
-
$4.40
-
-
Kimi K3 (max)
$2.66
-
$0.28
-
$13.30
-
-
CrusoeCrusoe
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
GLM 5.3 Flash
$0.15
-
$0.03
-
$0.50
-
-
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
DeepInfraDeepInfra
  • Prompt caching is automatic — no extra parameters required.
GLM-5.3 (max)
$1.20
-
$0.12
-
$4.00
-
-
GLM 5.3 Flash
$0.15
-
$0.03
-
$0.50
-
-
DigitalOceanDigitalOcean
GLM-5.3 (max)
$0.95
-
$0.20
-
$3.40
-
-
Kimi K3 (max)
$2.55
-
$0.28
-
$12.95
-
-
FireworksFireworks
  • Prompt caching is enabled by default.
  • The default discount is 50%, but the exact discount varies by model.
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
GLM 5.3 Flash
$0.15
-
$0.03
-
$0.50
-
-
GMIGMI
GLM-5.3 (max)
$1.40
-
$0.21
-
$4.40
-
-
GLM 5.3 Flash
$0.15
-
$0.03
-
$0.50
-
-
IncoInco
GLM-5.3 (max)
$2.80
-
$0.52
-
$8.80
-
-
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
MakoraMakora
GLM-5.3 (max)
$1.35
-
$0.23
-
$4.40
-
-
Kimi K3 (max)
$2.55
-
$0.26
-
$12.75
-
-
ModularModular
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
MiniMax-M3
$0.30
-
$0.06
-
$1.20
-
-
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
-
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
WaferWafer
GLM-5.3 (max)
$1.19
-
$0.26
-
$4.40
-
-
GLM 5.3 Flash
$0.15
-
$0.03
-
$0.50
-
-
ZaiZai
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
GLM 5.3 Flash
$0.15
-
$0.03
-
$0.50
-
-
Step 5 Preview
$1.00
-
$0.05
-
$2.70
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
LithosAILithosAI
Kimi K3 (max)
$2.40
-
$0.24
-
$12.00
-
-
Kimi K3 (max)
$4.00
-
$0.40
-
$20.00
-
-
ModalModal
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
GLM 5.3 Flash
$0.15
-
$0.05
-
$0.50
-
-
Qwen3.8 27B (xhigh)
$0.40
-
$0.15
-
$3.00
-
-
GLM 5.3 Flash
$0.15
-
$0.03
-
$0.50
-
-
DeepSeek V4.1 Flash (Reasoning, Max Effort)
$0.30
-
$0.01
-
$1.20
-
-
GLM 5.3 Flash
$0.15
-
$0.03
-
$0.50
-
-
DeepSeek V4.1 Flash (Reasoning, Max Effort)
$0.30
-
$0.01
-
$1.20
-
-
DeepSeekDeepSeek
  • Cache read tokens are 50% cheaper on average (up to 90% with cache optimization)
  • Implements Context Caching on Disk technology
  • No guarantee of 100% cache hits
DeepSeek V4.1 Flash (Reasoning, Max Effort)
$0.30
-
$0.01
-
$1.20
-
-
MistralMistral
Mistral Medium 3.5
$1.50
-
$0.15
-
$7.50
-
-
MiniMaxMiniMax
  • MiniMax supports Anthropic API compatible caching that is managed through explicit cache_control settings.
MiniMax-M3
$0.30
$0.38
$0.06
-
$1.20
-
-
Thinking MachinesThinking Machines
Inkling (xhigh)
$1.00
-
$0.17
-
$4.05
-
-
-

Introducción a la caché de prompts

¿Qué es la caché de prompts?

La caché de prompts permite que la inferencia de un modelo de lenguaje reutilice tokens de entrada ya procesados, reduciendo su costo hasta un 90% y haciendo viables las cargas de trabajo de contexto largo. Acertar con la estrategia de caché puede generar grandes ahorros en tokens de entrada y beneficios claros de rendimiento.

Cuando envías un prompt, el sistema primero comprueba si ese prompt exacto ya se procesó. Si se encuentra (acierto de caché), devuelve la respuesta almacenada en lugar de generar una nueva. Si no se encuentra (fallo de caché), el prompt se procesa con normalidad y la respuesta se guarda para usos futuros.

Métricas clave a seguir

  • Precio de entrada: El precio estándar que pagas por los tokens de entrada
  • Precio de escritura de caché: Lo que pagas por guardar tokens del prompt en la caché; a veces es más alto que el precio estándar de entrada
  • Precio de acierto de caché: Tarifa con descuento para los tokens del prompt que aciertan en la caché
  • Precio de almacenamiento de caché: Costo por hora por millón de tokens en caché (por ahora exclusivo de Google)
  • TTL de caché: El tiempo que los tokens en caché siguen disponibles, de horas a días
  • Mínimo de tokens de caché: Cantidad mínima de tokens coincidentes necesaria para servir un acierto de caché

¿Cómo funciona la caché de prompts?

Cuando envías un prompt a un modelo de lenguaje basado en transformers, las capas de atención procesan cada token de entrada en vectores de clave (K) y valor (V) que se almacenan en la caché KV. Al mantener estos valores en memoria, se puede evitar volver a procesar los tokens de entrada cuando se envían de nuevo tokens idénticos al modelo.

Hasta hace poco, aprovechar los beneficios de velocidad y costo de la caché solo era posible en despliegues dedicados. Ahora, los proveedores de API serverless —incluidos los laboratorios frontier— han empezado a trasladar parte de esos beneficios de costo a los desarrolladores.

Casos de uso óptimos

  • Instrucciones de sistema: Prompts de sistema extensos que deben incluirse en muchas interacciones
  • Historial de chat: El contexto de la conversación que acompaña cada nuevo turno del usuario
  • Contexto personalizado por usuario: Memorias o perfiles extensos que permiten una personalización profunda

Consideraciones de implementación

  • El método de activación varía según el proveedor: algunos requieren configuración manual y otros ofrecen caché automática
  • Los descuentos por acierto de caché van del 50% al 90% sobre el precio estándar de tokens de entrada: vale la pena invertir el tiempo en hacerlo bien
  • La caché mejora el rendimiento en prompts muy largos (más de 50k tokens)