Cache de prompts: análise de custo e desempenho entre provedores
O cache de prompts pode reduzir o custo dos tokens de entrada em até 90% e torna viáveis cargas de trabalho de contexto longo. Compare preços de cache, descontos e especificações de API dos principais provedores de IA abaixo.
O cache exige correspondências exatas do prompt e varia conforme o provedor — alguns como OpenAI e DeepSeek oferecem cache automático, enquanto outros, incluindo Google, Anthropic e Amazon, exigem configuração manual. Saiba mais sobre como funciona na nossa introdução ao cache de prompts abaixo.
Preços
Preços: acerto de cache, escrita no cache, entrada e saída
Desconto do cache
Pricing: Cache Discount
Especificações de API de cache de prompts
Provedor | Modelo | Entrada (padrão) | Escrita no cache | Acerto de cache | Armazenamento de cache | Saída (padrão) | Ativado automaticamente | Mín. tokens | TTL do cache | Notas |
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | $10.00 | $12.50 | $0.25 | $20.00 | $50.00 | - | - | ||
Claude Opus 5 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | $10.00 | $25.00 | - | - | 1h cache write: $10 | ||
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | - | $25.00 | - | - | ||
GPT-5.6 Sol (max) | $5.50 | $6.88 | $0.55 | - | $33.00 | - | - | |||
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | - | $25.00 | - | - | ||
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | $10.00 | $12.50 | $1.00 | - | $50.00 | - | - | |||
| GPT-5.6 Sol (max) | $4.00 | $5.00 | $0.40 | - | $20.00 | - | - | ||
GPT-5.6 Terra (max) | $2.00 | $2.50 | $0.20 | - | $12.00 | - | - | |||
| Grok 4.6 (high) | $2.00 | - | $0.50 | - | $6.00 | - | - | ||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
Kimi K3 (max) | $2.66 | - | $0.28 | - | $13.30 | - | - | |||
Qwen3.8 2.4T A95B | $1.90 | - | $0.19 | - | $5.70 | - | - | |||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | |||
GLM-5.3 (max) | $1.40 | - | $0.26 | - | $4.40 | - | - | |||
Kimi K3 (max) | $2.85 | - | $0.28 | - | $14.25 | - | - | |||
GLM-5.3 (max) | $1.40 | - | $0.26 | - | $4.40 | - | - | |||
| Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | ||
Kimi K3 (max) | $4.50 | - | $0.45 | - | $22.50 | - | - | |||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | |||
Kimi K3 (max) | $2.55 | - | $0.26 | - | $12.75 | - | - | |||
GLM-5.3 (max) | $1.35 | - | $0.23 | - | $4.40 | - | - | |||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | |||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | - | ||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | |||
Qwen3.8 2.4T A95B | $2.50 | - | $0.50 | - | $6.25 | - | - | |||
| GLM-5.3 (max) | $1.20 | - | $0.12 | - | $4.00 | - | - | ||
Qwen3.8 2.4T A95B | $2.00 | - | $0.20 | - | $6.00 | - | - | |||
GLM-5.3 (max) | $1.40 | - | $0.26 | - | $4.40 | - | - | |||
MiniMax-M3 | $0.30 | - | $0.06 | - | $1.20 | - | - | |||
GLM-5.3 (max) | $1.40 | - | $0.26 | - | $4.40 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
| Qwen3.8 2.4T A95B | $2.00 | - | $0.25 | - | $6.00 | - | - | ||
Qwen3.8 27B (xhigh) | $0.50 | - | $0.05 | - | $3.00 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
GLM-5.3-Flash | $0.07 | - | $0.01 | - | $0.25 | - | - | |||
DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $1.12 | - | $0.04 | - | $3.37 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $1.32 | - | $0.13 | - | $3.96 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $1.50 | - | $0.14 | - | $3.13 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
Muse Spark 1.2 (xhigh) | $1.25 | - | $0.15 | - | $4.25 | - | - | - | ||
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $1.32 | - | $0.04 | - | $3.96 | - | - | ||
Qwen3.8 27B (xhigh) | $0.40 | - | $0.15 | - | $3.00 | - | - | |||
MiniMax-M3 | $0.23 | - | $0.05 | - | $0.96 | - | - | |||
Mistral Medium 3.5 | $1.50 | - | $0.15 | - | $7.50 | - | - | |||
| MiniMax-M3 | $0.30 | $0.38 | $0.06 | - | $1.20 | - | - | ||
Inkling (xhigh) | $1.00 | - | $0.17 | - | $4.05 | - | - | - | ||
| gpt-oss-120b (high) | $0.15 | - | $0.07 | - | $0.60 | - | 2 hrs |
Introdução ao cache de prompts
O que é cache de prompts?
O cache de prompts permite que a inferência de um modelo de linguagem reutilize tokens de entrada já processados, reduzindo o custo em até 90% e tornando viáveis cargas de trabalho de contexto longo. Acertar a estratégia de cache pode gerar grandes economias nos tokens de entrada e benefícios reais de desempenho.
Quando você envia um prompt, o sistema primeiro verifica se aquele prompt exato já foi processado. Se encontrado (acerto de cache), devolve a resposta armazenada em vez de gerar uma nova. Se não encontrado (falha de cache), o prompt é processado normalmente e a resposta é guardada para uso futuro.
Métricas principais a acompanhar
- Preço de entrada: O preço padrão que você paga pelos tokens de entrada
- Preço de escrita no cache: O que você paga para salvar tokens do prompt no cache; às vezes é mais alto que o preço padrão de entrada
- Preço de acerto do cache: Tarifa com desconto para tokens do prompt que acertam o cache
- Preço de armazenamento de cache: Custo por hora por milhão de tokens em cache (atualmente exclusivo do Google)
- TTL do cache: O tempo em que os tokens em cache permanecem disponíveis, de horas a dias
- Mínimo de tokens de cache: Quantidade mínima de tokens coincidentes necessária antes de servir um acerto de cache
Como funciona o cache de prompts?
Quando você envia um prompt a um modelo de linguagem baseado em transformers, as camadas de atenção processam cada token de entrada em vetores de chave (K) e valor (V) armazenados no cache KV. Ao manter esses valores na memória, o processamento dos tokens de entrada pode ser evitado quando tokens idênticos são enviados novamente ao modelo.
Até recentemente, aproveitar os ganhos de velocidade e custo do cache só era possível em implantações dedicadas. Agora, provedores de API serverless — incluindo os laboratórios frontier — começaram a repassar parte dos benefícios de custo do cache aos desenvolvedores.
Casos de uso ideais
- Instruções de sistema: Prompts de sistema extensos que precisam ser incluídos em muitas interações
- Histórico do chat: O contexto da conversa que acompanha cada novo turno do usuário
- Contexto personalizado por usuário: Memórias ou perfis extensos que permitem personalização profunda
Considerações de implementação
- O método de ativação varia conforme o provedor — alguns exigem configuração manual, outros oferecem cache automático
- Os descontos por acerto de cache vão de 50% a 90% sobre o preço padrão de tokens de entrada — vale a pena investir tempo para acertar
- O cache melhora o desempenho em prompts muito longos (mais de 50 mil tokens)