Caché de prompts: análisis de costo y rendimiento entre proveedores

La caché de prompts puede reducir el costo de los tokens de entrada hasta un 90% y hace viables las cargas de trabajo de contexto largo. Compara precios de caché, descuentos y especificaciones de API de los principales proveedores de IA.

La caché exige coincidencias exactas del prompt y varía según el proveedor: algunos como OpenAI y DeepSeek ofrecen caché automática, mientras que otros, incluidos Google, Anthropic y Amazon, requieren configuración manual. Más detalles sobre cómo funciona en nuestra introducción a la caché de prompts más abajo.

Precios

Precios: acierto de caché, escritura de caché, entrada y salida

Price (USD per M Tokens)
Reasoning models are indicated by a lightbulb icon

Price per token for cached prompts (previously processed), typically offering a significant discount compared to regular input price, represented as USD per million tokens. The values shown here are the cache hit price; cache write and cache storage are billed separately and vary by provider — see "Cache pricing by provider" for detail.

Descuento de caché

Pricing: Cache Discount

1 - (cache hit price / input price) · Higher is better
Reasoning models are indicated by a lightbulb icon

Reduction in input token cost due to cache hit relative to input price. Formula: 1 - (Cache Hit Price per Token / Input Token Price), where cache hit price is the first-party cache hit price or the median provider cache hit price. Note that this discount figure does not account for all costs associated with cache hits, such as cache write and storage costs.

Especificaciones de API de caché de prompts

Proveedor
Modelo
Entrada (estándar)
Escritura de caché
Acierto de caché
Almacenamiento de caché
Salida (estándar)
Activado automáticamente
Mín. tokens
TTL de caché
Notas
Amazon BedrockAmazon Bedrock
  • Amazon supports caching for Nova models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
GPT-5.5 (xhigh)
$5.50
-
$0.55
-
$33.00
-
-
AnthropicAnthropic
  • Cache read tokens are 90% cheaper than base input tokens
  • Cache write tokens are 25% more expensive than base input tokens
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
$10.00
$12.50
$1.00
$20.00
$50.00
-
-
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
$10.00
$25.00
-
-

1h cache write: $10

GoogleGoogle
  • Google supports caching for Gemini models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
$10.00
$12.50
$1.00
-
$50.00
-
-
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
OpenAIOpenAI
  • Cache read tokens are 50% cheaper than base input tokens
  • Cache persists up to one hour during off-peak periods
GPT-5.5 (xhigh)
$5.00
-
$0.50
-
$30.00
1024
5-10 minutes
GPT-5.4 mini (xhigh)
$0.75
-
$0.07
-
$4.50
-
-
SpaceXAISpaceXAI
  • Prompt caching is not 100% guaranteed.
Grok 4.3 (high)
$1.25
$1.25
$0.20
-
$2.50
-
-

For requests greater than 200k tokens, pricing is $2.50 per 1M input tokens, $0.40 per 1M cached input tokens, and $5.00 per 1M output tokens

Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-
FireworksFireworks
  • Prompt caching is enabled by default.
  • The default discount is 50%, but the exact discount varies by model.
Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-
Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-
Kimi K2.6
$0.75
-
$0.16
-
$3.50
-
-
Microsoft AzureMicrosoft Azure

OpenAI models:

  • Cache read tokens are 50% cheaper than base input tokens (Standard deployments)
  • Cache persists up to one hour during off-peak periods
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)
$2.00
$2.50
$0.20
-
$10.00
-
-
GPT-5.4 mini (xhigh)
$0.75
-
$0.07
-
$4.50
-
-
DeepSeekDeepSeek
  • Cache read tokens are 50% cheaper on average (up to 90% with cache optimization)
  • Implements Context Caching on Disk technology
  • No guarantee of 100% cache hits
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$0.43
-
$0.00
-
$0.87
-
-
Kimi K2.6
$0.65
-
$0.15
-
$3.41
-
-
CrusoeCrusoe
Kimi K2.6
$0.70
-
$0.35
-
$3.50
-
-
DeepInfraDeepInfra
  • Prompt caching is automatic — no extra parameters required.
Kimi K2.6
$0.75
-
$0.15
-
$3.50
-
-
GMIGMI
Kimi K2.6
$0.85
-
$0.14
-
$3.60
-
-
Kimi K2.6
$0.80
-
$0.16
-
$3.40
-
-
Kimi K2.6
$0.77
-
$0.14
-
$3.40
-
-
CloudflareCloudflare
  • Prefix caching is enabled by default. To maximize cache hit rates, a header must be sent.
Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-

Introducción a la caché de prompts

¿Qué es la caché de prompts?

La caché de prompts permite que la inferencia de un modelo de lenguaje reutilice tokens de entrada ya procesados, reduciendo su costo hasta un 90% y haciendo viables las cargas de trabajo de contexto largo. Acertar con la estrategia de caché puede generar grandes ahorros en tokens de entrada y beneficios claros de rendimiento.

Cuando envías un prompt, el sistema primero comprueba si ese prompt exacto ya se procesó. Si se encuentra (acierto de caché), devuelve la respuesta almacenada en lugar de generar una nueva. Si no se encuentra (fallo de caché), el prompt se procesa con normalidad y la respuesta se guarda para usos futuros.

Métricas clave a seguir

  • Precio de entrada: El precio estándar que pagas por los tokens de entrada
  • Precio de escritura de caché: Lo que pagas por guardar tokens del prompt en la caché; a veces es más alto que el precio estándar de entrada
  • Precio de acierto de caché: Tarifa con descuento para los tokens del prompt que aciertan en la caché
  • Precio de almacenamiento de caché: Costo por hora por millón de tokens en caché (por ahora exclusivo de Google)
  • TTL de caché: El tiempo que los tokens en caché siguen disponibles, de horas a días
  • Mínimo de tokens de caché: Cantidad mínima de tokens coincidentes necesaria para servir un acierto de caché

¿Cómo funciona la caché de prompts?

Cuando envías un prompt a un modelo de lenguaje basado en transformers, las capas de atención procesan cada token de entrada en vectores de clave (K) y valor (V) que se almacenan en la caché KV. Al mantener estos valores en memoria, se puede evitar volver a procesar los tokens de entrada cuando se envían de nuevo tokens idénticos al modelo.

Hasta hace poco, aprovechar los beneficios de velocidad y costo de la caché solo era posible en despliegues dedicados. Ahora, los proveedores de API serverless —incluidos los laboratorios frontier— han empezado a trasladar parte de esos beneficios de costo a los desarrolladores.

Casos de uso óptimos

  • Instrucciones de sistema: Prompts de sistema extensos que deben incluirse en muchas interacciones
  • Historial de chat: El contexto de la conversación que acompaña cada nuevo turno del usuario
  • Contexto personalizado por usuario: Memorias o perfiles extensos que permiten una personalización profunda

Consideraciones de implementación

  • El método de activación varía según el proveedor: algunos requieren configuración manual y otros ofrecen caché automática
  • Los descuentos por acierto de caché van del 50% al 90% sobre el precio estándar de tokens de entrada: vale la pena invertir el tiempo en hacerlo bien
  • La caché mejora el rendimiento en prompts muy largos (más de 50k tokens)