プロンプトキャッシュ:プロバイダー横断のコストと性能分析
プロンプトキャッシュは入力トークンのコストを最大90%削減でき、長いコンテキストのワークロードを現実的にします。主要AIプロバイダーのキャッシュ料金、割引、API仕様を以下で比較できます。
キャッシュにはプロンプトの完全一致が必要で、プロバイダーによって異なります。OpenAIやDeepSeekのように自動キャッシュを提供する一方、Google、Anthropic、Amazonなどは手動設定が必要です。仕組みの詳細は、以下のプロンプトキャッシュの紹介をご覧ください。
料金
料金:キャッシュヒット、キャッシュ書き込み、入力、出力
キャッシュ割引
Pricing: Cache Discount
プロンプトキャッシュ API仕様
プロバイダー | モデル | 入力(標準) | キャッシュ書き込み | キャッシュヒット | キャッシュ保存 | 出力(標準) | 自動有効化 | 最小トークン数 | キャッシュTTL | 注記 |
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | $10.00 | $12.50 | $0.25 | $20.00 | $50.00 | - | - | ||
Claude Opus 5 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | $10.00 | $25.00 | - | - | 1h cache write: $10 | ||
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | - | $25.00 | - | - | ||
GPT-5.6 Sol (max) | $5.50 | $6.88 | $0.55 | - | $33.00 | - | - | |||
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | $5.00 | $6.25 | $0.50 | - | $25.00 | - | - | ||
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | $10.00 | $12.50 | $1.00 | - | $50.00 | - | - | |||
| GPT-5.6 Sol (max) | $4.00 | $5.00 | $0.40 | - | $20.00 | - | - | ||
GPT-5.6 Terra (max) | $2.00 | $2.50 | $0.20 | - | $12.00 | - | - | |||
| Grok 4.6 (high) | $2.00 | - | $0.50 | - | $6.00 | - | - | ||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
Kimi K3 (max) | $2.66 | - | $0.28 | - | $13.30 | - | - | |||
Qwen3.8 2.4T A95B | $1.90 | - | $0.19 | - | $5.70 | - | - | |||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | |||
GLM-5.3 (max) | $1.40 | - | $0.26 | - | $4.40 | - | - | |||
Kimi K3 (max) | $2.85 | - | $0.28 | - | $14.25 | - | - | |||
GLM-5.3 (max) | $1.40 | - | $0.26 | - | $4.40 | - | - | |||
| Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | ||
Kimi K3 (max) | $4.50 | - | $0.45 | - | $22.50 | - | - | |||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | |||
Kimi K3 (max) | $2.55 | - | $0.26 | - | $12.75 | - | - | |||
GLM-5.3 (max) | $1.35 | - | $0.23 | - | $4.40 | - | - | |||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | |||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | - | ||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
Kimi K3 (max) | $3.00 | - | $0.30 | - | $15.00 | - | - | |||
Qwen3.8 2.4T A95B | $2.50 | - | $0.50 | - | $6.25 | - | - | |||
| GLM-5.3 (max) | $1.20 | - | $0.12 | - | $4.00 | - | - | ||
Qwen3.8 2.4T A95B | $2.00 | - | $0.20 | - | $6.00 | - | - | |||
GLM-5.3 (max) | $1.40 | - | $0.26 | - | $4.40 | - | - | |||
MiniMax-M3 | $0.30 | - | $0.06 | - | $1.20 | - | - | |||
GLM-5.3 (max) | $1.40 | - | $0.26 | - | $4.40 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
| Qwen3.8 2.4T A95B | $2.00 | - | $0.25 | - | $6.00 | - | - | ||
Qwen3.8 27B (xhigh) | $0.50 | - | $0.05 | - | $3.00 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
GLM-5.3-Flash | $0.07 | - | $0.01 | - | $0.25 | - | - | |||
DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $1.12 | - | $0.04 | - | $3.37 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $1.32 | - | $0.13 | - | $3.96 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $1.50 | - | $0.14 | - | $3.13 | - | - | |||
GLM-5.3-Flash | $0.15 | - | $0.03 | - | $0.50 | - | - | |||
Muse Spark 1.2 (xhigh) | $1.25 | - | $0.15 | - | $4.25 | - | - | - | ||
| DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | $1.32 | - | $0.04 | - | $3.96 | - | - | ||
Qwen3.8 27B (xhigh) | $0.40 | - | $0.15 | - | $3.00 | - | - | |||
MiniMax-M3 | $0.23 | - | $0.05 | - | $0.96 | - | - | |||
Mistral Medium 3.5 | $1.50 | - | $0.15 | - | $7.50 | - | - | |||
| MiniMax-M3 | $0.30 | $0.38 | $0.06 | - | $1.20 | - | - | ||
Inkling (xhigh) | $1.00 | - | $0.17 | - | $4.05 | - | - | - | ||
| gpt-oss-120b (high) | $0.15 | - | $0.07 | - | $0.60 | - | 2 hrs |
プロンプトキャッシュの紹介
プロンプトキャッシュとは?
プロンプトキャッシュは、言語モデルの推論がすでに処理した入力トークンを再利用できるようにし、そのコストを最大90%削減して長いコンテキストのワークロードを現実的にします。キャッシュの方針を正しく設計すれば、入力トークンで大きなコスト削減と、意味のある性能向上が得られます。
プロンプトを送ると、システムはまずその完全に同じプロンプトが以前に処理されたかを確認します。見つかった場合(キャッシュヒット)は、新たに生成せず保存済みの応答を返します。見つからない場合(キャッシュミス)は、プロンプトを通常どおり処理し、応答を今後の利用のために保存します。
注目すべき主要指標
- 入力料金:入力トークンに対して支払う標準料金
- キャッシュ書き込み料金:プロンプトトークンをキャッシュに保存するために支払う料金。標準の入力料金より高い場合があります
- キャッシュヒット料金:キャッシュにヒットしたプロンプトトークンの割引料金
- キャッシュ保存料金:キャッシュされたトークン100万件あたりの時間単価(現在はGoogleのみ)
- キャッシュTTL:キャッシュされたトークンが利用可能な時間。数時間から数日まで
- キャッシュ最小トークン数:キャッシュヒットを返す前に必要な、一致するトークンの最小数
プロンプトキャッシュはどのように動くのか?
Transformerベースの言語モデルにプロンプトを送ると、アテンション層が各入力トークンをキー(K)とバリュー(V)のベクトルに処理し、KVキャッシュに保存します。これらの値をメモリに保持することで、同じ入力トークンが再びモデルに送られたときに入力トークンの処理を避けられます。
つい最近まで、キャッシュによる速度とコストの利点を活かせるのは専用デプロイに限られていました。現在は、サーバーレスAPIプロバイダー(フロンティアラボを含む)が、キャッシュのコストメリットの一部を開発者に還元し始めています。
最適なユースケース
- システム指示:多くのやり取りで必ず含める必要がある大きなシステムプロンプト
- チャット履歴:ユーザーの新しいターンごとに付く会話コンテキスト
- ユーザーごとのパーソナライズコンテキスト:深いパーソナライズを可能にする、大規模なユーザーメモリやプロファイル
実装上の考慮点
- 有効化の方法はプロバイダーによって異なります。手動設定が必要な場合もあれば、自動キャッシュを提供する場合もあります
- キャッシュヒットの割引は、標準の入力トークン料金から50~90%です。正しく設計する時間をかける価値があります
- キャッシュは非常に長いプロンプト(5万トークン以上)の性能を向上させます