Cache de prompts: análise de custo e desempenho entre provedores

O cache de prompts pode reduzir o custo dos tokens de entrada em até 90% e torna viáveis cargas de trabalho de contexto longo. Compare preços de cache, descontos e especificações de API dos principais provedores de IA abaixo.

O cache exige correspondências exatas do prompt e varia conforme o provedor — alguns como OpenAI e DeepSeek oferecem cache automático, enquanto outros, incluindo Google, Anthropic e Amazon, exigem configuração manual. Saiba mais sobre como funciona na nossa introdução ao cache de prompts abaixo.

Preços

Preços: acerto de cache, escrita no cache, entrada e saída

Price (USD per M Tokens)
Reasoning models are indicated by a lightbulb icon

Price per token for cached prompts (previously processed), typically offering a significant discount compared to regular input price, represented as USD per million tokens. The values shown here are the cache hit price; cache write and cache storage are billed separately and vary by provider — see "Cache pricing by provider" for detail.

Desconto do cache

Pricing: Cache Discount

1 - (cache hit price / input price) · Higher is better
Reasoning models are indicated by a lightbulb icon

Reduction in input token cost due to cache hit relative to input price. Formula: 1 - (Cache Hit Price per Token / Input Token Price), where cache hit price is the first-party cache hit price or the median provider cache hit price. Note that this discount figure does not account for all costs associated with cache hits, such as cache write and storage costs.

Especificações de API de cache de prompts

Provedor
Modelo
Entrada (padrão)
Escrita no cache
Acerto de cache
Armazenamento de cache
Saída (padrão)
Ativado automaticamente
Mín. tokens
TTL do cache
Notas
Amazon BedrockAmazon Bedrock
  • Amazon supports caching for Nova models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
GPT-5.5 (xhigh)
$5.50
-
$0.55
-
$33.00
-
-
AnthropicAnthropic
  • Cache read tokens are 90% cheaper than base input tokens
  • Cache write tokens are 25% more expensive than base input tokens
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
$10.00
$12.50
$1.00
$20.00
$50.00
-
-
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
$10.00
$25.00
-
-

1h cache write: $10

GoogleGoogle
  • Google supports caching for Gemini models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
$10.00
$12.50
$1.00
-
$50.00
-
-
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
OpenAIOpenAI
  • Cache read tokens are 50% cheaper than base input tokens
  • Cache persists up to one hour during off-peak periods
GPT-5.5 (xhigh)
$5.00
-
$0.50
-
$30.00
1024
5-10 minutes
GPT-5.4 mini (xhigh)
$0.75
-
$0.07
-
$4.50
-
-
SpaceXAISpaceXAI
  • Prompt caching is not 100% guaranteed.
Grok 4.3 (high)
$1.25
$1.25
$0.20
-
$2.50
-
-

For requests greater than 200k tokens, pricing is $2.50 per 1M input tokens, $0.40 per 1M cached input tokens, and $5.00 per 1M output tokens

Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-
FireworksFireworks
  • Prompt caching is enabled by default.
  • The default discount is 50%, but the exact discount varies by model.
Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-
Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-
Kimi K2.6
$0.75
-
$0.16
-
$3.50
-
-
Microsoft AzureMicrosoft Azure

OpenAI models:

  • Cache read tokens are 50% cheaper than base input tokens (Standard deployments)
  • Cache persists up to one hour during off-peak periods
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)
$2.00
$2.50
$0.20
-
$10.00
-
-
GPT-5.4 mini (xhigh)
$0.75
-
$0.07
-
$4.50
-
-
DeepSeekDeepSeek
  • Cache read tokens are 50% cheaper on average (up to 90% with cache optimization)
  • Implements Context Caching on Disk technology
  • No guarantee of 100% cache hits
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$0.43
-
$0.00
-
$0.87
-
-
Kimi K2.6
$0.65
-
$0.15
-
$3.41
-
-
CrusoeCrusoe
Kimi K2.6
$0.70
-
$0.35
-
$3.50
-
-
DeepInfraDeepInfra
  • Prompt caching is automatic — no extra parameters required.
Kimi K2.6
$0.75
-
$0.15
-
$3.50
-
-
GMIGMI
Kimi K2.6
$0.85
-
$0.14
-
$3.60
-
-
Kimi K2.6
$0.80
-
$0.16
-
$3.40
-
-
Kimi K2.6
$0.77
-
$0.14
-
$3.40
-
-
CloudflareCloudflare
  • Prefix caching is enabled by default. To maximize cache hit rates, a header must be sent.
Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-

Introdução ao cache de prompts

O que é cache de prompts?

O cache de prompts permite que a inferência de um modelo de linguagem reutilize tokens de entrada já processados, reduzindo o custo em até 90% e tornando viáveis cargas de trabalho de contexto longo. Acertar a estratégia de cache pode gerar grandes economias nos tokens de entrada e benefícios reais de desempenho.

Quando você envia um prompt, o sistema primeiro verifica se aquele prompt exato já foi processado. Se encontrado (acerto de cache), devolve a resposta armazenada em vez de gerar uma nova. Se não encontrado (falha de cache), o prompt é processado normalmente e a resposta é guardada para uso futuro.

Métricas principais a acompanhar

  • Preço de entrada: O preço padrão que você paga pelos tokens de entrada
  • Preço de escrita no cache: O que você paga para salvar tokens do prompt no cache; às vezes é mais alto que o preço padrão de entrada
  • Preço de acerto do cache: Tarifa com desconto para tokens do prompt que acertam o cache
  • Preço de armazenamento de cache: Custo por hora por milhão de tokens em cache (atualmente exclusivo do Google)
  • TTL do cache: O tempo em que os tokens em cache permanecem disponíveis, de horas a dias
  • Mínimo de tokens de cache: Quantidade mínima de tokens coincidentes necessária antes de servir um acerto de cache

Como funciona o cache de prompts?

Quando você envia um prompt a um modelo de linguagem baseado em transformers, as camadas de atenção processam cada token de entrada em vetores de chave (K) e valor (V) armazenados no cache KV. Ao manter esses valores na memória, o processamento dos tokens de entrada pode ser evitado quando tokens idênticos são enviados novamente ao modelo.

Até recentemente, aproveitar os ganhos de velocidade e custo do cache só era possível em implantações dedicadas. Agora, provedores de API serverless — incluindo os laboratórios frontier — começaram a repassar parte dos benefícios de custo do cache aos desenvolvedores.

Casos de uso ideais

  • Instruções de sistema: Prompts de sistema extensos que precisam ser incluídos em muitas interações
  • Histórico do chat: O contexto da conversa que acompanha cada novo turno do usuário
  • Contexto personalizado por usuário: Memórias ou perfis extensos que permitem personalização profunda

Considerações de implementação

  • O método de ativação varia conforme o provedor — alguns exigem configuração manual, outros oferecem cache automático
  • Os descontos por acerto de cache vão de 50% a 90% sobre o preço padrão de tokens de entrada — vale a pena investir tempo para acertar
  • O cache melhora o desempenho em prompts muito longos (mais de 50 mil tokens)