Caché de prompts: análisis de costo y rendimiento entre proveedores

La caché de prompts puede reducir el costo de los tokens de entrada hasta un 90% y hace viables las cargas de trabajo de contexto largo. Compara precios de caché, descuentos y especificaciones de API de los principales proveedores de IA.

La caché exige coincidencias exactas del prompt y varía según el proveedor: algunos como OpenAI y DeepSeek ofrecen caché automática, mientras que otros, incluidos Google, Anthropic y Amazon, requieren configuración manual. Más detalles sobre cómo funciona en nuestra introducción a la caché de prompts más abajo.

Precios

Precios: acierto de caché, escritura de caché, entrada y salida

Price (USD per M Tokens)

Price per token for cached prompts (previously processed), typically offering a significant discount compared to regular input price, represented as USD per million tokens. The values shown here are the cache hit price; cache write and cache storage are billed separately and vary by provider — see "Cache pricing by provider" for detail.

Descuento de caché

Pricing: Cache Discount

1 - (cache hit price / input price) · Higher is better

Reduction in input token cost due to cache hit relative to input price. Formula: 1 - (Cache Hit Price per Token / Input Token Price), where cache hit price is the first-party cache hit price or the median provider cache hit price. Note that this discount figure does not account for all costs associated with cache hits, such as cache write and storage costs.

Especificaciones de API de caché de prompts

Proveedor
Modelo
Entrada (estándar)
Escritura de caché
Acierto de caché
Almacenamiento de caché
Salida (estándar)
Activado automáticamente
Mín. tokens
TTL de caché
Notas
AnthropicAnthropic
  • Cache read tokens are 90% cheaper than base input tokens
  • Cache write tokens are 25% more expensive than base input tokens
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
$10.00
$12.50
$0.25
$20.00
$50.00
-
-
Claude Opus 5 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
$10.00
$25.00
-
-

1h cache write: $10

Amazon BedrockAmazon Bedrock
  • Amazon supports caching for Nova models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Opus 5 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
GPT-5.6 Sol (max)
$5.50
$6.88
$0.55
-
$33.00
-
-
GoogleGoogle
  • Google supports caching for Gemini models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Opus 5 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
$10.00
$12.50
$1.00
-
$50.00
-
-
OpenAIOpenAI
  • Cache read tokens are 50% cheaper than base input tokens
  • Cache persists up to one hour during off-peak periods
GPT-5.6 Sol (max)
$4.00
$5.00
$0.40
-
$20.00
-
-
GPT-5.6 Terra (max)
$2.00
$2.50
$0.20
-
$12.00
-
-
SpaceXAISpaceXAI
  • Prompt caching is not 100% guaranteed.
Grok 4.6 (high)
$2.00
-
$0.50
-
$6.00
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
Bitdeer AIBitdeer AI
Kimi K3 (max)
$2.66
-
$0.28
-
$13.30
-
-
Qwen3.8 2.4T A95B
$1.90
-
$0.19
-
$5.70
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
DigitalOceanDigitalOcean
Kimi K3 (max)
$2.85
-
$0.28
-
$14.25
-
-
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
FireworksFireworks
  • Prompt caching is enabled by default.
  • The default discount is 50%, but the exact discount varies by model.
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
Kimi K3 (max)
$4.50
-
$0.45
-
$22.50
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
MakoraMakora
Kimi K3 (max)
$2.55
-
$0.26
-
$12.75
-
-
GLM-5.3 (max)
$1.35
-
$0.23
-
$4.40
-
-
ModalModal
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
Qwen3.8 2.4T A95B
$2.50
-
$0.50
-
$6.25
-
-
DeepInfraDeepInfra
  • Prompt caching is automatic — no extra parameters required.
GLM-5.3 (max)
$1.20
-
$0.12
-
$4.00
-
-
Qwen3.8 2.4T A95B
$2.00
-
$0.20
-
$6.00
-
-
ModularModular
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
MiniMax-M3
$0.30
-
$0.06
-
$1.20
-
-
ZaiZai
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
Alibaba CloudAlibaba Cloud
  • Alibaba offers two cache types: implicit and explicit.
  • Implicit cache is automatically enabled. It is billed at 20% of the standard input token price.
  • Explicit cache must be activated. It creates a cache for specific content to ensure a deterministic hit within its 5-minute validity period. Tokens used to create the cache are billed at 125% of the standard input token price, while subsequent cache hits are billed at 10% of that price.
Qwen3.8 2.4T A95B
$2.00
-
$0.25
-
$6.00
-
-
Qwen3.8 27B (xhigh)
$0.50
-
$0.05
-
$3.00
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
GMIGMI
GLM-5.3-Flash
$0.07
-
$0.01
-
$0.25
-
-
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$1.12
-
$0.04
-
$3.37
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$1.32
-
$0.13
-
$3.96
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$1.50
-
$0.14
-
$3.13
-
-
WaferWafer
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
MetaMeta
Muse Spark 1.2 (xhigh)
$1.25
-
$0.15
-
$4.25
-
-
-
DeepSeekDeepSeek
  • Cache read tokens are 50% cheaper on average (up to 90% with cache optimization)
  • Implements Context Caching on Disk technology
  • No guarantee of 100% cache hits
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$1.32
-
$0.04
-
$3.96
-
-
Qwen3.8 27B (xhigh)
$0.40
-
$0.15
-
$3.00
-
-
MiniMax-M3
$0.23
-
$0.05
-
$0.96
-
-
MistralMistral
Mistral Medium 3.5
$1.50
-
$0.15
-
$7.50
-
-
MiniMaxMiniMax
  • MiniMax supports Anthropic API compatible caching that is managed through explicit cache_control settings.
MiniMax-M3
$0.30
$0.38
$0.06
-
$1.20
-
-
Thinking MachinesThinking Machines
Inkling (xhigh)
$1.00
-
$0.17
-
$4.05
-
-
-
GroqGroq
  • The minimum cacheable prompt length varies by model, ranging from 128 to 1024 tokens depending on the specific model used.
  • All cached data automatically expires after 2 hours without use.
gpt-oss-120b (high)
$0.15
-
$0.07
-
$0.60
-
2 hrs

Introducción a la caché de prompts

¿Qué es la caché de prompts?

La caché de prompts permite que la inferencia de un modelo de lenguaje reutilice tokens de entrada ya procesados, reduciendo su costo hasta un 90% y haciendo viables las cargas de trabajo de contexto largo. Acertar con la estrategia de caché puede generar grandes ahorros en tokens de entrada y beneficios claros de rendimiento.

Cuando envías un prompt, el sistema primero comprueba si ese prompt exacto ya se procesó. Si se encuentra (acierto de caché), devuelve la respuesta almacenada en lugar de generar una nueva. Si no se encuentra (fallo de caché), el prompt se procesa con normalidad y la respuesta se guarda para usos futuros.

Métricas clave a seguir

  • Precio de entrada: El precio estándar que pagas por los tokens de entrada
  • Precio de escritura de caché: Lo que pagas por guardar tokens del prompt en la caché; a veces es más alto que el precio estándar de entrada
  • Precio de acierto de caché: Tarifa con descuento para los tokens del prompt que aciertan en la caché
  • Precio de almacenamiento de caché: Costo por hora por millón de tokens en caché (por ahora exclusivo de Google)
  • TTL de caché: El tiempo que los tokens en caché siguen disponibles, de horas a días
  • Mínimo de tokens de caché: Cantidad mínima de tokens coincidentes necesaria para servir un acierto de caché

¿Cómo funciona la caché de prompts?

Cuando envías un prompt a un modelo de lenguaje basado en transformers, las capas de atención procesan cada token de entrada en vectores de clave (K) y valor (V) que se almacenan en la caché KV. Al mantener estos valores en memoria, se puede evitar volver a procesar los tokens de entrada cuando se envían de nuevo tokens idénticos al modelo.

Hasta hace poco, aprovechar los beneficios de velocidad y costo de la caché solo era posible en despliegues dedicados. Ahora, los proveedores de API serverless —incluidos los laboratorios frontier— han empezado a trasladar parte de esos beneficios de costo a los desarrolladores.

Casos de uso óptimos

  • Instrucciones de sistema: Prompts de sistema extensos que deben incluirse en muchas interacciones
  • Historial de chat: El contexto de la conversación que acompaña cada nuevo turno del usuario
  • Contexto personalizado por usuario: Memorias o perfiles extensos que permiten una personalización profunda

Consideraciones de implementación

  • El método de activación varía según el proveedor: algunos requieren configuración manual y otros ofrecen caché automática
  • Los descuentos por acierto de caché van del 50% al 90% sobre el precio estándar de tokens de entrada: vale la pena invertir el tiempo en hacerlo bien
  • La caché mejora el rendimiento en prompts muy largos (más de 50k tokens)