Prompt-Caching: Kosten- und Leistungsanalyse über Anbieter hinweg
Prompt-Caching kann die Kosten für Eingabetokens um bis zu 90 % senken und macht Workloads mit langem Kontext wirtschaftlich. Vergleichen Sie Cache-Preise, Rabatte und API-Spezifikationen der großen KI-Anbieter.
Caching erfordert exakte Prompt-Übereinstimmungen und unterscheidet sich je nach Anbieter – einige wie OpenAI und DeepSeek bieten automatisches Caching, andere einschließlich Google, Anthropic und Amazon erfordern eine manuelle Einrichtung. Mehr dazu in unserer Einführung in Prompt-Caching weiter unten.
Preise
Preise: Cache-Treffer, Cache-Schreiben, Eingabe und Ausgabe
Cache-Rabatt
Pricing: Cache Discount
API-Spezifikationen für Prompt-Caching
Anbieter | Modell | Eingabe (Standard) | Cache-Schreiben | Cache-Treffer | Cache-Speicher | Ausgabe (Standard) | Automatisch aktiviert | Min. Tokens | Cache-TTL | Hinweise |
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | - | $25.00 | - | - | ||
GPT-5.5 (xhigh) | $5.50 | - | $0.55 | - | $33.00 | - | - | |||
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | $10.00 | $12.50 | $1.00 | $20.00 | $50.00 | - | - | ||
Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | $10.00 | $25.00 | - | - | 1h cache write: $10 | ||
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | $10.00 | $12.50 | $1.00 | - | $50.00 | - | - | ||
Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | - | $25.00 | - | - | |||
| GPT-5.5 (xhigh) | $5.00 | - | $0.50 | - | $30.00 | 1024 | 5-10 minutes
| ||
GPT-5.4 mini (xhigh) | $0.75 | - | $0.07 | - | $4.50 | - | - | |||
| Grok 4.3 (high) | $1.25 | $1.25 | $0.20 | - | $2.50 | - | - | For requests greater than 200k tokens, pricing is $2.50 per 1M input tokens, $0.40 per 1M cached input tokens, and $5.00 per 1M output tokens | |
Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - | |||
| Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - | ||
Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - | |||
Kimi K2.6 | $0.75 | - | $0.16 | - | $3.50 | - | - | |||
OpenAI models:
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | $2.00 | $2.50 | $0.20 | - | $10.00 | - | - | ||
GPT-5.4 mini (xhigh) | $0.75 | - | $0.07 | - | $4.50 | - | - | |||
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $0.43 | - | $0.00 | - | $0.87 | - | - | ||
Kimi K2.6 | $0.65 | - | $0.15 | - | $3.41 | - | - | |||
Kimi K2.6 | $0.70 | - | $0.35 | - | $3.50 | - | - | |||
| Kimi K2.6 | $0.75 | - | $0.15 | - | $3.50 | - | - | ||
Kimi K2.6 | $0.85 | - | $0.14 | - | $3.60 | - | - | |||
Kimi K2.6 | $0.80 | - | $0.16 | - | $3.40 | - | - | |||
Kimi K2.6 | $0.77 | - | $0.14 | - | $3.40 | - | - | |||
| Kimi K2.6 | $0.95 | - | $0.16 | - | $4.00 | - | - |
Einführung in Prompt-Caching
Was ist Prompt-Caching?
Prompt-Caching ermöglicht es der Inferenz von Sprachmodellen, bereits verarbeitete Eingabetokens wiederzuverwenden, ihre Kosten um bis zu 90 % zu senken und Workloads mit langem Kontext wirtschaftlich zu machen. Wer Caching richtig angeht, kann bei Eingabetokens stark sparen und spürbare Leistungsvorteile erzielen.
Wenn Sie einen Prompt senden, prüft das System zuerst, ob genau dieser Prompt bereits verarbeitet wurde. Bei einem Treffer (Cache-Hit) wird die gespeicherte Antwort zurückgegeben, statt eine neue zu erzeugen. Wird nichts gefunden (Cache-Miss), wird der Prompt normal verarbeitet und die Antwort für die spätere Nutzung gespeichert.
Wichtige Kennzahlen
- Eingabepreis: Der Standardpreis, den Sie für Eingabetokens zahlen
- Cache-Schreibpreis: Was Sie zahlen, um Prompt-Tokens im Cache zu speichern; manchmal höher als der Standard-Eingabepreis
- Preis bei Cache-Treffer: Reduzierter Satz für Prompt-Tokens, die den Cache treffen
- Cache-Speicherpreis: Stündliche Kosten pro Million gecachter Tokens (derzeit nur bei Google)
- Cache-TTL: Die Zeit, für die gecachte Tokens verfügbar bleiben, von Stunden bis Tagen
- Mindestanzahl Cache-Tokens: Mindestzahl übereinstimmender Tokens, bevor ein Cache-Treffer ausgeliefert wird
Wie funktioniert Prompt-Caching?
Wenn Sie einen Prompt an ein transformer-basiertes Sprachmodell senden, verarbeiten die Attention-Schichten jedes Eingabetoken zu Key- (K) und Value-Vektoren (V), die im KV-Cache gespeichert werden. Bleiben diese Werte im Speicher, kann die Verarbeitung der Eingabetokens entfallen, wenn erneut identische Eingabetokens an das Modell gesendet werden.
Bis vor kurzem waren die Geschwindigkeits- und Kostenvorteile des Cachings nur in dedizierten Deployments nutzbar. Inzwischen geben serverless-API-Anbieter – einschließlich der Frontier-Labs – einen Teil der Kostenvorteile des Cachings an Entwickler weiter.
Optimale Anwendungsfälle
- Systemanweisungen: Große Systemprompts, die in vielen Interaktionen enthalten sein müssen
- Chatverlauf: Gesprächskontext, der jede neue Nutzeräußerung begleitet
- Personalisierter Kontext pro Nutzer: Umfangreiche Nutzermemories oder Profile für tiefe Personalisierung
Hinweise zur Umsetzung
- Die Aktivierung unterscheidet sich je nach Anbieter – manche erfordern eine manuelle Einrichtung, andere bieten automatisches Caching
- Rabatte bei Cache-Treffern liegen bei 50–90 % unter dem Standardpreis für Eingabetokens – es lohnt sich, das richtig umzusetzen
- Caching verbessert die Leistung bei sehr langen Prompts (50k+ Tokens)