Prompt-Caching: Kosten- und Leistungsanalyse über Anbieter hinweg

Prompt-Caching kann die Kosten für Eingabetokens um bis zu 90 % senken und macht Workloads mit langem Kontext wirtschaftlich. Vergleichen Sie Cache-Preise, Rabatte und API-Spezifikationen der großen KI-Anbieter.

Caching erfordert exakte Prompt-Übereinstimmungen und unterscheidet sich je nach Anbieter – einige wie OpenAI und DeepSeek bieten automatisches Caching, andere einschließlich Google, Anthropic und Amazon erfordern eine manuelle Einrichtung. Mehr dazu in unserer Einführung in Prompt-Caching weiter unten.

Preise

Preise: Cache-Treffer, Cache-Schreiben, Eingabe und Ausgabe

Price (USD per M Tokens)
Reasoning models are indicated by a lightbulb icon

Price per token for cached prompts (previously processed), typically offering a significant discount compared to regular input price, represented as USD per million tokens. The values shown here are the cache hit price; cache write and cache storage are billed separately and vary by provider — see "Cache pricing by provider" for detail.

Cache-Rabatt

Pricing: Cache Discount

1 - (cache hit price / input price) · Higher is better
Reasoning models are indicated by a lightbulb icon

Reduction in input token cost due to cache hit relative to input price. Formula: 1 - (Cache Hit Price per Token / Input Token Price), where cache hit price is the first-party cache hit price or the median provider cache hit price. Note that this discount figure does not account for all costs associated with cache hits, such as cache write and storage costs.

API-Spezifikationen für Prompt-Caching

Anbieter
Modell
Eingabe (Standard)
Cache-Schreiben
Cache-Treffer
Cache-Speicher
Ausgabe (Standard)
Automatisch aktiviert
Min. Tokens
Cache-TTL
Hinweise
Amazon BedrockAmazon Bedrock
  • Amazon supports caching for Nova models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
GPT-5.5 (xhigh)
$5.50
-
$0.55
-
$33.00
-
-
AnthropicAnthropic
  • Cache read tokens are 90% cheaper than base input tokens
  • Cache write tokens are 25% more expensive than base input tokens
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
$10.00
$12.50
$1.00
$20.00
$50.00
-
-
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
$10.00
$25.00
-
-

1h cache write: $10

GoogleGoogle
  • Google supports caching for Gemini models and Anthropic's Claude models.
  • Pricing and usage differs between model families.
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
$10.00
$12.50
$1.00
-
$50.00
-
-
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
$5.00
$6.25
$0.50
-
$25.00
-
-
OpenAIOpenAI
  • Cache read tokens are 50% cheaper than base input tokens
  • Cache persists up to one hour during off-peak periods
GPT-5.5 (xhigh)
$5.00
-
$0.50
-
$30.00
1024
5-10 minutes
GPT-5.4 mini (xhigh)
$0.75
-
$0.07
-
$4.50
-
-
SpaceXAISpaceXAI
  • Prompt caching is not 100% guaranteed.
Grok 4.3 (high)
$1.25
$1.25
$0.20
-
$2.50
-
-

For requests greater than 200k tokens, pricing is $2.50 per 1M input tokens, $0.40 per 1M cached input tokens, and $5.00 per 1M output tokens

Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-
FireworksFireworks
  • Prompt caching is enabled by default.
  • The default discount is 50%, but the exact discount varies by model.
Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-
Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-
Kimi K2.6
$0.75
-
$0.16
-
$3.50
-
-
Microsoft AzureMicrosoft Azure

OpenAI models:

  • Cache read tokens are 50% cheaper than base input tokens (Standard deployments)
  • Cache persists up to one hour during off-peak periods
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)
$2.00
$2.50
$0.20
-
$10.00
-
-
GPT-5.4 mini (xhigh)
$0.75
-
$0.07
-
$4.50
-
-
DeepSeekDeepSeek
  • Cache read tokens are 50% cheaper on average (up to 90% with cache optimization)
  • Implements Context Caching on Disk technology
  • No guarantee of 100% cache hits
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
$0.43
-
$0.00
-
$0.87
-
-
Kimi K2.6
$0.65
-
$0.15
-
$3.41
-
-
CrusoeCrusoe
Kimi K2.6
$0.70
-
$0.35
-
$3.50
-
-
DeepInfraDeepInfra
  • Prompt caching is automatic — no extra parameters required.
Kimi K2.6
$0.75
-
$0.15
-
$3.50
-
-
GMIGMI
Kimi K2.6
$0.85
-
$0.14
-
$3.60
-
-
Kimi K2.6
$0.80
-
$0.16
-
$3.40
-
-
Kimi K2.6
$0.77
-
$0.14
-
$3.40
-
-
CloudflareCloudflare
  • Prefix caching is enabled by default. To maximize cache hit rates, a header must be sent.
Kimi K2.6
$0.95
-
$0.16
-
$4.00
-
-

Einführung in Prompt-Caching

Was ist Prompt-Caching?

Prompt-Caching ermöglicht es der Inferenz von Sprachmodellen, bereits verarbeitete Eingabetokens wiederzuverwenden, ihre Kosten um bis zu 90 % zu senken und Workloads mit langem Kontext wirtschaftlich zu machen. Wer Caching richtig angeht, kann bei Eingabetokens stark sparen und spürbare Leistungsvorteile erzielen.

Wenn Sie einen Prompt senden, prüft das System zuerst, ob genau dieser Prompt bereits verarbeitet wurde. Bei einem Treffer (Cache-Hit) wird die gespeicherte Antwort zurückgegeben, statt eine neue zu erzeugen. Wird nichts gefunden (Cache-Miss), wird der Prompt normal verarbeitet und die Antwort für die spätere Nutzung gespeichert.

Wichtige Kennzahlen

  • Eingabepreis: Der Standardpreis, den Sie für Eingabetokens zahlen
  • Cache-Schreibpreis: Was Sie zahlen, um Prompt-Tokens im Cache zu speichern; manchmal höher als der Standard-Eingabepreis
  • Preis bei Cache-Treffer: Reduzierter Satz für Prompt-Tokens, die den Cache treffen
  • Cache-Speicherpreis: Stündliche Kosten pro Million gecachter Tokens (derzeit nur bei Google)
  • Cache-TTL: Die Zeit, für die gecachte Tokens verfügbar bleiben, von Stunden bis Tagen
  • Mindestanzahl Cache-Tokens: Mindestzahl übereinstimmender Tokens, bevor ein Cache-Treffer ausgeliefert wird

Wie funktioniert Prompt-Caching?

Wenn Sie einen Prompt an ein transformer-basiertes Sprachmodell senden, verarbeiten die Attention-Schichten jedes Eingabetoken zu Key- (K) und Value-Vektoren (V), die im KV-Cache gespeichert werden. Bleiben diese Werte im Speicher, kann die Verarbeitung der Eingabetokens entfallen, wenn erneut identische Eingabetokens an das Modell gesendet werden.

Bis vor kurzem waren die Geschwindigkeits- und Kostenvorteile des Cachings nur in dedizierten Deployments nutzbar. Inzwischen geben serverless-API-Anbieter – einschließlich der Frontier-Labs – einen Teil der Kostenvorteile des Cachings an Entwickler weiter.

Optimale Anwendungsfälle

  • Systemanweisungen: Große Systemprompts, die in vielen Interaktionen enthalten sein müssen
  • Chatverlauf: Gesprächskontext, der jede neue Nutzeräußerung begleitet
  • Personalisierter Kontext pro Nutzer: Umfangreiche Nutzermemories oder Profile für tiefe Personalisierung

Hinweise zur Umsetzung

  • Die Aktivierung unterscheidet sich je nach Anbieter – manche erfordern eine manuelle Einrichtung, andere bieten automatisches Caching
  • Rabatte bei Cache-Treffern liegen bei 50–90 % unter dem Standardpreis für Eingabetokens – es lohnt sich, das richtig umzusetzen
  • Caching verbessert die Leistung bei sehr langen Prompts (50k+ Tokens)