Cache de prompts: análise de custo e desempenho entre provedores
O cache de prompts pode reduzir o custo dos tokens de entrada em até 90% e torna viáveis cargas de trabalho de contexto longo. Compare preços de cache, descontos e especificações de API dos principais provedores de IA abaixo.
O cache exige correspondências exatas do prompt e varia conforme o provedor — alguns como OpenAI e DeepSeek oferecem cache automático, enquanto outros, incluindo Google, Anthropic e Amazon, exigem configuração manual. Saiba mais sobre como funciona na nossa introdução ao cache de prompts abaixo.
Preços
Preços: acerto de cache, escrita no cache, entrada e saída
Desconto do cache
Pricing: Cache Discount
Especificações de API de cache de prompts
Provedor | Modelo | Entrada (padrão) | Escrita no cache | Acerto de cache | Armazenamento de cache | Saída (padrão) | Ativado automaticamente | Mín. tokens | TTL do cache | Notas |
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | - | $25.00 | - | - | ||
GPT-5.5 (xhigh) | $5.50 | - | $0.55 | - | $33.00 | - | - | |||
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | $10.00 | $12.50 | $1.00 | $20.00 | $50.00 | - | - | ||
Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | $10.00 | $25.00 | - | - | 1h cache write: $10 | ||
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | $10.00 | $12.50 | $1.00 | - | $50.00 | - | - | ||
Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | - | $25.00 | - | - | |||
| GPT-5.5 (xhigh) | $5.00 | - | $0.50 | - | $30.00 | 1024 | 5-10 minutes
| ||
GPT-5.4 mini (xhigh) | $0.75 | - | $0.07 | - | $4.50 | - | - | |||
| Grok 4.3 (high) | $1.25 | $1.25 | $0.20 | - | $2.50 | - | - | For requests greater than 200k tokens, pricing is $2.50 per 1M input tokens, $0.40 per 1M cached input tokens, and $5.00 per 1M output tokens | |
Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - | |||
| Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - | ||
Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - | |||
Kimi K2.6 | $0.75 | - | $0.16 | - | $3.50 | - | - | |||
OpenAI models:
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | $2.00 | $2.50 | $0.20 | - | $10.00 | - | - | ||
GPT-5.4 mini (xhigh) | $0.75 | - | $0.07 | - | $4.50 | - | - | |||
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $0.43 | - | $0.00 | - | $0.87 | - | - | ||
Kimi K2.6 | $0.65 | - | $0.15 | - | $3.41 | - | - | |||
Kimi K2.6 | $0.70 | - | $0.35 | - | $3.50 | - | - | |||
| Kimi K2.6 | $0.75 | - | $0.15 | - | $3.50 | - | - | ||
Kimi K2.6 | $0.85 | - | $0.14 | - | $3.60 | - | - | |||
Kimi K2.6 | $0.80 | - | $0.16 | - | $3.40 | - | - | |||
Kimi K2.6 | $0.77 | - | $0.14 | - | $3.40 | - | - | |||
| Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - |
Introdução ao cache de prompts
O que é cache de prompts?
O cache de prompts permite que a inferência de um modelo de linguagem reutilize tokens de entrada já processados, reduzindo o custo em até 90% e tornando viáveis cargas de trabalho de contexto longo. Acertar a estratégia de cache pode gerar grandes economias nos tokens de entrada e benefícios reais de desempenho.
Quando você envia um prompt, o sistema primeiro verifica se aquele prompt exato já foi processado. Se encontrado (acerto de cache), devolve a resposta armazenada em vez de gerar uma nova. Se não encontrado (falha de cache), o prompt é processado normalmente e a resposta é guardada para uso futuro.
Métricas principais a acompanhar
- Preço de entrada: O preço padrão que você paga pelos tokens de entrada
- Preço de escrita no cache: O que você paga para salvar tokens do prompt no cache; às vezes é mais alto que o preço padrão de entrada
- Preço de acerto do cache: Tarifa com desconto para tokens do prompt que acertam o cache
- Preço de armazenamento de cache: Custo por hora por milhão de tokens em cache (atualmente exclusivo do Google)
- TTL do cache: O tempo em que os tokens em cache permanecem disponíveis, de horas a dias
- Mínimo de tokens de cache: Quantidade mínima de tokens coincidentes necessária antes de servir um acerto de cache
Como funciona o cache de prompts?
Quando você envia um prompt a um modelo de linguagem baseado em transformers, as camadas de atenção processam cada token de entrada em vetores de chave (K) e valor (V) armazenados no cache KV. Ao manter esses valores na memória, o processamento dos tokens de entrada pode ser evitado quando tokens idênticos são enviados novamente ao modelo.
Até recentemente, aproveitar os ganhos de velocidade e custo do cache só era possível em implantações dedicadas. Agora, provedores de API serverless — incluindo os laboratórios frontier — começaram a repassar parte dos benefícios de custo do cache aos desenvolvedores.
Casos de uso ideais
- Instruções de sistema: Prompts de sistema extensos que precisam ser incluídos em muitas interações
- Histórico do chat: O contexto da conversa que acompanha cada novo turno do usuário
- Contexto personalizado por usuário: Memórias ou perfis extensos que permitem personalização profunda
Considerações de implementação
- O método de ativação varia conforme o provedor — alguns exigem configuração manual, outros oferecem cache automático
- Os descontos por acerto de cache vão de 50% a 90% sobre o preço padrão de tokens de entrada — vale a pena investir tempo para acertar
- O cache melhora o desempenho em prompts muito longos (mais de 50 mil tokens)