プロンプトキャッシュとは — 「cache hit」の一行を料金で読み解く
用語説明 第2回。料金表やニュースに出てくる用語を、一次情報まで戻して分解します。 今回のテーマは プロンプトキャッシュ。DeepSeekの公式料金ページにあるこの一行から始めます。 同じ入力なのに、単価が50倍違う——理由を説明できるでしょうか。
「入力(cache hit)$0.003 / 1Mトークン」
まず3つの言葉に分ける
料金表に出てくるのは、この3つだけです。用語が分かれれば、あとは単価を当てはめるだけになります。
仕組み — 「先頭から一致した部分」だけが再利用される
- 「先頭から一致」は4社に共通する考え方です。OpenAIはプロンプトのプレフィックス(先頭部分)の再計算を避けると説明し、Anthropicは「プロンプト全体(ツール・システム・メッセージ)のプレフィックス」をキャッシュすると明記しています。Geminiも公式ドキュメントで「大きく共通な内容をプロンプトの先頭に置く」「近い時間に同じ前置きで送る」ことを推奨しています。
- 後ろは自由に変えられます。前置き(システム指示・参照資料・ツール定義)を固定し、可変部分を最後に置く。これだけでヒット率が変わります。
- ヒットしたかどうかは応答から確認できます。OpenAIは
usage.input_tokens_details.cached_tokensとcache_write_tokens、Anthropicはcache_read_input_tokensとcache_creation_input_tokens、Geminiはusage.total_cached_tokensを返します。まず実測してから最適化するのが順序です。
プロバイダ別のルール(一次情報)
「キャッシュ」と一口に言っても、書き込みの課金・保持時間・キャッシュされる最小の長さが各社で違います。ここは公式ドキュメントの記載をそのまま並べます。
| プロバイダ | 書込の課金 | 読込(cache hit) | 保持時間(TTL) | キャッシュされる最小長 |
|---|---|---|---|---|
| OpenAI (GPT-5.6以降) | 1.25×(標準入力比) | 0.1×=最大90%引き | 30分(prompt_cache_options.ttl の対応値は "30m" のみ=既定) | —(モデル依存・自動) |
| Anthropic (Claude) | 5分TTL: 1.25× 1時間TTL: 2× | 0.1× ※Fable 5.1 / Mythos 5.1 は 0.025× | 既定5分(使われるたび無料で更新)/1時間は追加料金 | 512トークン(Fable 5.1・Mythos 5.1・Opus 5)/2,048(その他)/4,096(Haiku 4.5) |
| Google (Gemini) | 明示キャッシュは保存料金が別建て | 入力の10% | 暗黙キャッシュは自動/明示キャッシュはTTLを指定 | 4,096(3.x Flash系・3.1 Pro Preview)/2,048(2.5系) |
| DeepSeek | 書込の課金記載なし(初回は通常入力として課金) | cache miss の 1/50 | 自動(既定で有効・コード変更不要) | —(先頭一致の単位で自動) |
出典: OpenAI Prompt caching・Anthropic Prompt caching(最小トークン数・乗数)・Gemini Context caching(暗黙キャッシュはGemini 2.5以降で既定有効・最小トークン数)・DeepSeek Context Caching(いずれも2026-09-17確認)。Anthropicの主な乗数は「5分書込=1.25倍/1時間書込=2倍/読込=0.1倍(ヒットとリフレッシュ)」で、Fable 5.1・Mythos 5.1のみ読込が0.025倍と明記されています。
実額で並べる(USD / 1Mトークン)
| モデル | 通常入力 | cache hit | キャッシュ書込 |
|---|---|---|---|
| GPT-6 Astra | $10.00 | $1.00 | $12.50 |
| Claude Fable 5.1 | $10.00 | $0.25 | $12.50(5分)/ $20(1時間) |
| Gemini 3.8 Flash(〜12/31) | $0.75 | $0.075 | 保存 $0.50 / 1M / 時間 |
| DeepSeek V4.1 Flash(オフピーク) | $0.15 | $0.003 | なし(初回は通常入力) |
| Grok 4.6 | $2.00 | $0.50 | — |
| GLM-5.3-Flash | $0.15 | $0.03 | 保存は期間限定無料 |
| MAI-Thinking-1(Azure Global) | $2.00 | $0.20 | — |
各社公式料金ページの値(当サイトで検証済み)。詳細と出典URLは料金比較に掲載しています。Geminiは初回価格(2026年12月31日まで)で、2027年1月1日以降は $1.50 / $0.15 に上がります。
10回送ったら、いくら変わるか(試算)
条件: 8,000トークンの共通の前置きを、10リクエストで毎回同じ順序で送る。出力は無視。書込は1回目のみ発生し、2〜10回目はすべて cache hit すると仮定します。
| モデル | キャッシュなし | キャッシュあり | 差 |
|---|---|---|---|
| GPT-6 Astra($10 / $1.00 / $12.50) | $0.80 | $0.172 | 約78%減 |
| Claude Fable 5.1($10 / $0.25 / $12.50) | $0.80 | $0.118 | 約85%減 |
| DeepSeek V4.1 Flash($0.15 / $0.003・オフピーク) | $0.012 | $0.0014 | 約88%減 |
- 計算の中身(GPT-6 Astra): キャッシュなしは 8,000 × 10 = 80,000トークン × $10 / 1M = $0.80。キャッシュありは、1回目の書込 8,000 × $12.50 / 1M = $0.10 と、2〜10回目の読込 72,000 × $1.00 / 1M = $0.072 の合計 $0.172 です。
- 書込の1.25倍は、2回目以降で回収されます。再利用が2回以上あれば、書込の割増(0.25倍ぶん)は読込の割引(0.9倍ぶん)で消えます。逆に1回しか送らないなら、$12.50 / 1M を払うだけ損です。
- 削減率が高い=安い、ではありません。DeepSeekは削減率88%でも総額は$0.0014、GPT-6 Astraは78%でも$0.172と、100倍以上違います。比較するときは割引率ではなく総額で見てください。
- 出力は割引の対象外です。キャッシュできるのは入力だけ。出力が長いワークロードでは、体感の削減率は表より小さくなります。総額の試算はトークン計算機でどうぞ(計算機はキャッシュなしの標準レートで計算します)。
単価は各社公式ページの公表値、試算は当サイトによる単純計算です。実際の請求額はキャッシュのヒット状況・TTLの切れ方・出力トークン数で変わります。
ありがちな誤解4つ
まとめ — 料金表でこの3つを見る
「cache hit」を見つけたら
- 通常入力との倍率 — 0.1倍か、0.025倍か、1/50か。ここがキャッシュの価値です。
- 書込の倍率とTTL — 1.25倍・2倍、5分・30分・1時間。ここが「元が取れるか」を決めます。
- 最小トークン数 — 512〜4,096。ここを下回ると効果はゼロです。
プロンプトキャッシュは、「同じ前置きを何度も送る設計」への報酬です。逆に言えば、プロンプトの組み立てを変えるだけで請求額が動く領域でもあります。エージェントのように同じシステム指示・ツール定義・参照資料を毎ターン送る構成ほど、効き方が大きくなります。
次に読む
単価の一覧は料金比較、実際の試算はトークン計算機へ。個別モデルの実例はDeepSeek V4.1 Flash・GPT-6 Astraで確認できます。
📊 料金比較表を見る →用語説明 · ベンチ数値の読み方 · トークン計算機 · リリース年表 · MS AI (MAI)
⚠️ 免責事項
- 料金・仕様は2026-09-17に各社公式ページ・公式ドキュメントで確認したものです。予告なく変動します。契約前に必ず公式ページをご確認ください。
- 本ページの試算は公表単価に基づく単純計算で、実際の請求額を保証するものではありません。キャッシュのヒット状況はワークロードによって変わります。
- キャッシュの実装・既定値・乗数は各社が変更する可能性があります。実装前に各社の最新ドキュメントをご確認ください。