プロンプトキャッシュとは — 「cache hit」の一行を料金で読み解く

用語説明 第2回。料金表やニュースに出てくる用語を、一次情報まで戻して分解します。 今回のテーマは プロンプトキャッシュ。DeepSeekの公式料金ページにあるこの一行から始めます。 同じ入力なのに、単価が50倍違う——理由を説明できるでしょうか。

「入力(cache hit)$0.003 / 1Mトークン」

出典: DeepSeek 公式料金ページ(V4.1 Flash=deepseek-flash、2026-09-17確認)— 同じ表の「入力(cache miss)」はオフピーク $0.15 / 1M。つまり cache hit は cache miss の 1/50 です。料金の詳細

● 最終更新:  |  一次情報: OpenAI Prompt caching・Anthropic Prompt caching・Gemini Context caching・DeepSeek Context Caching  |  確認日: 2026-09-17

まず3つの言葉に分ける

料金表に出てくるのは、この3つだけです。用語が分かれれば、あとは単価を当てはめるだけになります。

cache miss(キャッシュミス)
通常の入力単価
キャッシュに無かった入力。初回のリクエストは必ずこれ
cache hit(キャッシュヒット)
割引単価
前回と同じ前置きがキャッシュに残っていた入力。安い側
cache write(キャッシュ書込)
1.25〜2倍
キャッシュに保存するときの課金。ここが「高い側」になる
結論: プロンプトキャッシュは「割引」ではなく「前払い」です。 初回に少し割高な書込を払い、2回目以降の読込で回収する構造。だから1回しか送らないプロンプトでは、キャッシュは損になります。この非対称性が、実務でいちばん誤解されるポイントです。

仕組み — 「先頭から一致した部分」だけが再利用される

結論: キャッシュが効くのは、プロンプトの先頭から連続して一致した部分だけです。 プロバイダは入力トークンを先頭から順に照合し、前回と同じ並びが続く範囲を再計算せずに使い回します。動的な値(日時・ユーザーID・今回の質問)を先頭に置くと、そこで一致が切れて毎回 miss になります。
プロンプトキャッシュの仕組み: 先頭の共通部分は1回目に書き込まれ(1.25倍)、2回目以降は読み出し(0.1倍)で安くなる。10リクエストで $0.80 が $0.172 になる例 プロンプトキャッシュの仕組み 同じ前置きを毎回送るなら、2回目からは安い。例: GPT-6 Astra(入力 $10 / cache hit $1.00 / cache write $12.50、1Mトークンあたり) プロンプトの構造 共通の前置き(システム指示・資料)8,000トークン 今回の質問(毎回変わる) 1回目(キャッシュに無い) 書込 cache write 1.25× $12.50 / 1M 2回目以降(先頭が一致する) 読込 cache hit 0.1× $1.00 / 1M 10リクエスト分の入力コスト(8,000トークンの前置きを毎回送る場合) キャッシュなし $0.80 キャッシュあり $0.172(約78%減)
先頭の共通部分だけがキャッシュ対象。1回目は1.25倍で書き込み、2回目以降は0.1倍で読み出します(単価はOpenAI GPT-6 Astraの例)。
  • 「先頭から一致」は4社に共通する考え方です。OpenAIはプロンプトのプレフィックス(先頭部分)の再計算を避けると説明し、Anthropicは「プロンプト全体(ツール・システム・メッセージ)のプレフィックス」をキャッシュすると明記しています。Geminiも公式ドキュメントで「大きく共通な内容をプロンプトの先頭に置く」「近い時間に同じ前置きで送る」ことを推奨しています。
  • 後ろは自由に変えられます。前置き(システム指示・参照資料・ツール定義)を固定し、可変部分を最後に置く。これだけでヒット率が変わります。
  • ヒットしたかどうかは応答から確認できます。OpenAIは usage.input_tokens_details.cached_tokens と cache_write_tokens、Anthropicは cache_read_input_tokens と cache_creation_input_tokens、Geminiは usage.total_cached_tokens を返します。まず実測してから最適化するのが順序です。

プロバイダ別のルール(一次情報)

「キャッシュ」と一口に言っても、書き込みの課金・保持時間・キャッシュされる最小の長さが各社で違います。ここは公式ドキュメントの記載をそのまま並べます。

プロバイダ書込の課金読込(cache hit)保持時間(TTL)キャッシュされる最小長
OpenAI
(GPT-5.6以降)
1.25×(標準入力比)0.1×=最大90%引き30分(prompt_cache_options.ttl の対応値は "30m" のみ=既定)—(モデル依存・自動)
Anthropic
(Claude)
5分TTL: 1.25×
1時間TTL: 2×
0.1×
※Fable 5.1 / Mythos 5.1 は 0.025×
既定5分(使われるたび無料で更新)/1時間は追加料金512トークン(Fable 5.1・Mythos 5.1・Opus 5)/2,048(その他)/4,096(Haiku 4.5)
Google
(Gemini)
明示キャッシュは保存料金が別建て入力の10%暗黙キャッシュは自動/明示キャッシュはTTLを指定4,096(3.x Flash系・3.1 Pro Preview)/2,048(2.5系)
DeepSeek書込の課金記載なし(初回は通常入力として課金)cache miss の 1/50自動(既定で有効・コード変更不要)—(先頭一致の単位で自動)

出典: OpenAI Prompt caching・Anthropic Prompt caching(最小トークン数・乗数)・Gemini Context caching(暗黙キャッシュはGemini 2.5以降で既定有効・最小トークン数)・DeepSeek Context Caching(いずれも2026-09-17確認)。Anthropicの主な乗数は「5分書込=1.25倍/1時間書込=2倍/読込=0.1倍(ヒットとリフレッシュ)」で、Fable 5.1・Mythos 5.1のみ読込が0.025倍と明記されています。

実額で並べる(USD / 1Mトークン)

モデル通常入力cache hitキャッシュ書込
GPT-6 Astra$10.00$1.00$12.50
Claude Fable 5.1$10.00$0.25$12.50(5分)/ $20(1時間)
Gemini 3.8 Flash(〜12/31)$0.75$0.075保存 $0.50 / 1M / 時間
DeepSeek V4.1 Flash(オフピーク)$0.15$0.003なし(初回は通常入力)
Grok 4.6$2.00$0.50—
GLM-5.3-Flash$0.15$0.03保存は期間限定無料
MAI-Thinking-1(Azure Global)$2.00$0.20—

各社公式料金ページの値(当サイトで検証済み)。詳細と出典URLは料金比較に掲載しています。Geminiは初回価格(2026年12月31日まで)で、2027年1月1日以降は $1.50 / $0.15 に上がります。

10回送ったら、いくら変わるか(試算)

条件: 8,000トークンの共通の前置きを、10リクエストで毎回同じ順序で送る。出力は無視。書込は1回目のみ発生し、2〜10回目はすべて cache hit すると仮定します。

モデルキャッシュなしキャッシュあり差
GPT-6 Astra($10 / $1.00 / $12.50)$0.80$0.172約78%減
Claude Fable 5.1($10 / $0.25 / $12.50)$0.80$0.118約85%減
DeepSeek V4.1 Flash($0.15 / $0.003・オフピーク)$0.012$0.0014約88%減
  • 計算の中身(GPT-6 Astra): キャッシュなしは 8,000 × 10 = 80,000トークン × $10 / 1M = $0.80。キャッシュありは、1回目の書込 8,000 × $12.50 / 1M = $0.10 と、2〜10回目の読込 72,000 × $1.00 / 1M = $0.072 の合計 $0.172 です。
  • 書込の1.25倍は、2回目以降で回収されます。再利用が2回以上あれば、書込の割増(0.25倍ぶん)は読込の割引(0.9倍ぶん)で消えます。逆に1回しか送らないなら、$12.50 / 1M を払うだけ損です。
  • 削減率が高い=安い、ではありません。DeepSeekは削減率88%でも総額は$0.0014、GPT-6 Astraは78%でも$0.172と、100倍以上違います。比較するときは割引率ではなく総額で見てください。
  • 出力は割引の対象外です。キャッシュできるのは入力だけ。出力が長いワークロードでは、体感の削減率は表より小さくなります。総額の試算はトークン計算機でどうぞ(計算機はキャッシュなしの標準レートで計算します)。

単価は各社公式ページの公表値、試算は当サイトによる単純計算です。実際の請求額はキャッシュのヒット状況・TTLの切れ方・出力トークン数で変わります。

ありがちな誤解4つ

① 「キャッシュは自動だから、何もしなくても安くなる」 自動で有効なのは事実です(OpenAIは既定で有効、Geminiは2.5以降で既定有効、DeepSeekも全ユーザーで有効)。ただしヒットするかどうかは、プロンプトの先頭が一致するかにかかっています。先頭にタイムスタンプや乱数を入れると、自動有効でも毎回 miss になります。
② 「書込は無料で、読込だけ安くなる」 逆です。書込は1.25倍(Anthropicの1時間TTLなら2倍)で、読込が0.1倍。OpenAIのドキュメントも「再利用されると分かっているときに書込コストを払う価値がある」と書いています。使い捨ての長文コンテキストは、キャッシュ設計がないかぎり最も高くつきます。
③ 「短いプロンプトでもキャッシュされる」 最小の長さを下回ると、そもそもキャッシュされません。Anthropicは512 / 2,048 / 4,096トークン(モデル別)、Geminiは4,096トークン(3.x Flash系)と明記しています。短い指示文をいくら使い回しても、cache hit は発生しません。
④ 「キャッシュが効けば、費用は同じ割合で下がる」 下がるのは入力のうちキャッシュに載った部分だけです。出力単価はそのまま。さらにTTLが切れれば次のリクエストは miss に戻ります(Anthropicの既定は5分、OpenAIのGPT-5.6以降は30分)。「安くなる前提」で設計するときは、TTLとリクエスト間隔を必ずセットで確認してください。

まとめ — 料金表でこの3つを見る

「cache hit」を見つけたら

  • 通常入力との倍率 — 0.1倍か、0.025倍か、1/50か。ここがキャッシュの価値です。
  • 書込の倍率とTTL — 1.25倍・2倍、5分・30分・1時間。ここが「元が取れるか」を決めます。
  • 最小トークン数 — 512〜4,096。ここを下回ると効果はゼロです。

プロンプトキャッシュは、「同じ前置きを何度も送る設計」への報酬です。逆に言えば、プロンプトの組み立てを変えるだけで請求額が動く領域でもあります。エージェントのように同じシステム指示・ツール定義・参照資料を毎ターン送る構成ほど、効き方が大きくなります。

次に読む

単価の一覧は料金比較、実際の試算はトークン計算機へ。個別モデルの実例はDeepSeek V4.1 Flash・GPT-6 Astraで確認できます。

📊 料金比較表を見る →

用語説明 · ベンチ数値の読み方 · トークン計算機 · リリース年表 · MS AI (MAI)

⚠️ 免責事項

  • 料金・仕様は2026-09-17に各社公式ページ・公式ドキュメントで確認したものです。予告なく変動します。契約前に必ず公式ページをご確認ください。
  • 本ページの試算は公表単価に基づく単純計算で、実際の請求額を保証するものではありません。キャッシュのヒット状況はワークロードによって変わります。
  • キャッシュの実装・既定値・乗数は各社が変更する可能性があります。実装前に各社の最新ドキュメントをご確認ください。