Cache de prompts: análise de custo e desempenho entre provedores

O cache de prompts pode reduzir o custo dos tokens de entrada em até 90% e torna viáveis cargas de trabalho de contexto longo. Compare preços de cache, descontos e especificações de API dos principais provedores de IA abaixo.

O cache exige correspondências exatas do prompt e varia conforme o provedor — alguns como OpenAI e DeepSeek oferecem cache automático, enquanto outros, incluindo Google, Anthropic e Amazon, exigem configuração manual. Saiba mais sobre como funciona na nossa introdução ao cache de prompts abaixo.

Preços

Preços: acerto de cache, escrita no cache, entrada e saída

Price (USD per M Tokens)

Price per token for cached prompts (previously processed), typically offering a significant discount compared to regular input price, represented as USD per million tokens. The values shown here are the cache hit price; cache write and cache storage are billed separately and vary by provider — see "Cache pricing by provider" for detail.

Desconto do cache

Pricing: Cache Discount

1 - (cache hit price / input price) · Higher is better

Reduction in input token cost due to cache hit relative to input price. Formula: 1 - (Cache Hit Price per Token / Input Token Price), where cache hit price is the first-party cache hit price or the median provider cache hit price. Note that this discount figure does not account for all costs associated with cache hits, such as cache write and storage costs.

Especificações de API de cache de prompts

Provedor
Modelo
Entrada (padrão)
Escrita no cache
Acerto de cache
Armazenamento de cache
Saída (padrão)
Ativado automaticamente
Mín. tokens
TTL do cache
Notas
AnthropicAnthropic
  • Cache read tokens are 90% cheaper than base input tokens
  • Cache write tokens are 25% more expensive than base input tokens
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
$10.00
$12.50
$0.25
$20.00
$50.00
-
-
Claude Opus 5 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
$10.00
$25.00
-
-

1h cache write: $10

Amazon BedrockAmazon Bedrock
  • Amazon supports caching for Nova models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Opus 5 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
GPT-5.6 Sol (max)
$5.50
$6.88
$0.55
-
$33.00
-
-
GoogleGoogle
  • Google supports caching for Gemini models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Opus 5 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
$10.00
$12.50
$1.00
-
$50.00
-
-
OpenAIOpenAI
  • Cache read tokens are 50% cheaper than base input tokens
  • Cache persists up to one hour during off-peak periods
GPT-5.6 Sol (max)
$4.00
$5.00
$0.40
-
$20.00
-
-
GPT-5.6 Terra (max)
$2.00
$2.50
$0.20
-
$12.00
-
-
SpaceXAISpaceXAI
  • Prompt caching is not 100% guaranteed.
Grok 4.6 (high)
$2.00
-
$0.50
-
$6.00
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
Bitdeer AIBitdeer AI
Kimi K3 (max)
$2.66
-
$0.28
-
$13.30
-
-
Qwen3.8 2.4T A95B
$1.90
-
$0.19
-
$5.70
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
DigitalOceanDigitalOcean
Kimi K3 (max)
$2.85
-
$0.28
-
$14.25
-
-
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
FireworksFireworks
  • Prompt caching is enabled by default.
  • The default discount is 50%, but the exact discount varies by model.
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
Kimi K3 (max)
$4.50
-
$0.45
-
$22.50
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
MakoraMakora
Kimi K3 (max)
$2.55
-
$0.26
-
$12.75
-
-
GLM-5.3 (max)
$1.35
-
$0.23
-
$4.40
-
-
ModalModal
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
Kimi K3 (max)
$3.00
-
$0.30
-
$15.00
-
-
Qwen3.8 2.4T A95B
$2.50
-
$0.50
-
$6.25
-
-
DeepInfraDeepInfra
  • Prompt caching is automatic — no extra parameters required.
GLM-5.3 (max)
$1.20
-
$0.12
-
$4.00
-
-
Qwen3.8 2.4T A95B
$2.00
-
$0.20
-
$6.00
-
-
ModularModular
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
MiniMax-M3
$0.30
-
$0.06
-
$1.20
-
-
ZaiZai
GLM-5.3 (max)
$1.40
-
$0.26
-
$4.40
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
Alibaba CloudAlibaba Cloud
  • Alibaba offers two cache types: implicit and explicit.
  • Implicit cache is automatically enabled. It is billed at 20% of the standard input token price.
  • Explicit cache must be activated. It creates a cache for specific content to ensure a deterministic hit within its 5-minute validity period. Tokens used to create the cache are billed at 125% of the standard input token price, while subsequent cache hits are billed at 10% of that price.
Qwen3.8 2.4T A95B
$2.00
-
$0.25
-
$6.00
-
-
Qwen3.8 27B (xhigh)
$0.50
-
$0.05
-
$3.00
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
GMIGMI
GLM-5.3-Flash
$0.07
-
$0.01
-
$0.25
-
-
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$1.12
-
$0.04
-
$3.37
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$1.32
-
$0.13
-
$3.96
-
-
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$1.50
-
$0.14
-
$3.13
-
-
WaferWafer
GLM-5.3-Flash
$0.15
-
$0.03
-
$0.50
-
-
MetaMeta
Muse Spark 1.2 (xhigh)
$1.25
-
$0.15
-
$4.25
-
-
-
DeepSeekDeepSeek
  • Cache read tokens are 50% cheaper on average (up to 90% with cache optimization)
  • Implements Context Caching on Disk technology
  • No guarantee of 100% cache hits
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$1.32
-
$0.04
-
$3.96
-
-
Qwen3.8 27B (xhigh)
$0.40
-
$0.15
-
$3.00
-
-
MiniMax-M3
$0.23
-
$0.05
-
$0.96
-
-
MistralMistral
Mistral Medium 3.5
$1.50
-
$0.15
-
$7.50
-
-
MiniMaxMiniMax
  • MiniMax supports Anthropic API compatible caching that is managed through explicit cache_control settings.
MiniMax-M3
$0.30
$0.38
$0.06
-
$1.20
-
-
Thinking MachinesThinking Machines
Inkling (xhigh)
$1.00
-
$0.17
-
$4.05
-
-
-
GroqGroq
  • The minimum cacheable prompt length varies by model, ranging from 128 to 1024 tokens depending on the specific model used.
  • All cached data automatically expires after 2 hours without use.
gpt-oss-120b (high)
$0.15
-
$0.07
-
$0.60
-
2 hrs

Introdução ao cache de prompts

O que é cache de prompts?

O cache de prompts permite que a inferência de um modelo de linguagem reutilize tokens de entrada já processados, reduzindo o custo em até 90% e tornando viáveis cargas de trabalho de contexto longo. Acertar a estratégia de cache pode gerar grandes economias nos tokens de entrada e benefícios reais de desempenho.

Quando você envia um prompt, o sistema primeiro verifica se aquele prompt exato já foi processado. Se encontrado (acerto de cache), devolve a resposta armazenada em vez de gerar uma nova. Se não encontrado (falha de cache), o prompt é processado normalmente e a resposta é guardada para uso futuro.

Métricas principais a acompanhar

  • Preço de entrada: O preço padrão que você paga pelos tokens de entrada
  • Preço de escrita no cache: O que você paga para salvar tokens do prompt no cache; às vezes é mais alto que o preço padrão de entrada
  • Preço de acerto do cache: Tarifa com desconto para tokens do prompt que acertam o cache
  • Preço de armazenamento de cache: Custo por hora por milhão de tokens em cache (atualmente exclusivo do Google)
  • TTL do cache: O tempo em que os tokens em cache permanecem disponíveis, de horas a dias
  • Mínimo de tokens de cache: Quantidade mínima de tokens coincidentes necessária antes de servir um acerto de cache

Como funciona o cache de prompts?

Quando você envia um prompt a um modelo de linguagem baseado em transformers, as camadas de atenção processam cada token de entrada em vetores de chave (K) e valor (V) armazenados no cache KV. Ao manter esses valores na memória, o processamento dos tokens de entrada pode ser evitado quando tokens idênticos são enviados novamente ao modelo.

Até recentemente, aproveitar os ganhos de velocidade e custo do cache só era possível em implantações dedicadas. Agora, provedores de API serverless — incluindo os laboratórios frontier — começaram a repassar parte dos benefícios de custo do cache aos desenvolvedores.

Casos de uso ideais

  • Instruções de sistema: Prompts de sistema extensos que precisam ser incluídos em muitas interações
  • Histórico do chat: O contexto da conversa que acompanha cada novo turno do usuário
  • Contexto personalizado por usuário: Memórias ou perfis extensos que permitem personalização profunda

Considerações de implementação

  • O método de ativação varia conforme o provedor — alguns exigem configuração manual, outros oferecem cache automático
  • Os descontos por acerto de cache vão de 50% a 90% sobre o preço padrão de tokens de entrada — vale a pena investir tempo para acertar
  • O cache melhora o desempenho em prompts muito longos (mais de 50 mil tokens)