1Mコンテキストとは — 100万トークンで何が入るか、いくらになるか

用語説明 第4回。今回のテーマは 1Mコンテキスト です。 「100万トークンまで入ります」と書いてあっても、そこには2つの別の話が混ざっています。1つは何が入るのか(容量の話)、もう1つは入れたらいくらになるのか(料金の話)。 そして料金のほうは、OpenAI・Google・Anthropic の3社で設計が大きく違います(OpenAI と Google は境界を超えると全体の単価が上がり、Anthropic は対象の1Mモデルで標準単価のままです)。しかも長く入れれば賢くなるわけでもありません。 数字と出典を並べながら、最後には「自分の使い方だとどうなるか」まで持って帰れる形にします。

「1Mトークンまで入る」=「100万トークンぶん賢く使える」ではない

コンテキストウィンドウは物理的な上限(入るかどうか)を決めるだけで、その中身を均等に扱えるかや入れた分が定額かは別問題です。今回の記事はこの3つを切り分けるのが目的です。

まずイメージから。1Mコンテキストは、ものすごく広い机を借りるようなものです。ただし積むほど目的の書類を探しにくくなり、しかも机の広さと運賃が連動しています。ある量を超えると「その分だけ」ではなく「今回の荷物ぜんぶ」の運賃が倍になる——これが OpenAI と Google の段階課金です。Anthropic は「机が広くなっても運賃は同じ」という方式です。

結論 — 上限は「入る量」、課金は「入れた瞬間のルール」

コンテキストウィンドウは、モデルが1回のリクエストで同時に見られる情報量の上限です。 ここが1M(100万)トークンということは、システムプロンプト・会話履歴・貼り付けた資料・ツールの出力など、すべてを合計して100万トークンまで1回で渡せるという意味です。
ただし「100万まで入る」ことと「100万まで同じ値段」は別の話です。 長文の扱いは3社でルールが違います。要点だけ先に置くと——
  • OpenAI: 272K(27.2万)トークンを超えると、リクエスト全体が入力2倍・出力1.5倍。超えた分だけではありません。
  • Google: 200K(20万)トークンを超えると、すべてのトークンが高い方の単価で課金されます。
  • Anthropic: 1Mでも標準単価のまま(900Kのリクエストも9Kと同じ単価、と公式に明記)。
同じ「1Mコンテキスト」でも、同じ100万トークンを送ったときの請求額が全く違うということです。

なお、この言葉が料金表で使われるときは3つの数字が紛れ込みがちです。①入力の上限(コンテキストウィンドウ)、②出力の上限(max output tokens)、③長文課金の境界。 たとえば GPT-6 Astra は1,050,000 / 128,000 / 272K の3つが別々に存在します。この記事ではこの3つを区別して扱います。

1Mトークンとは、実際どれくらいか

「100万」と言われても実感がないので、身近な単位に置き換えます。トークンは文字数とは違うので、あくまで目安として見てください。

English text
約75万語
1トークン≒0.75語の単純換算。1ページ500語なら約1,500ページ、10万語の技術書なら7〜8冊ぶん
日本語テキスト
英語より少ない
同じ文でも日本語はトークン数が英語より多くなりがちで、入る文字数は減ります。正確な数はトークナイザ依存のため計算機で実測を
音声(Gemini換算)
約11時間
Gemini は音声1秒=25トークンと案内しているため、1,000,000÷25=40,000秒=約11.1時間ぶん(当サイトの単純計算)
画像・PDF(Claude)
最大600枚
Anthropic は「1リクエストに最大600枚の画像またはPDFページ」と明記(200Kのモデルは100枚)
Anthropic 公式ドキュメントの逐語: "A single request can include up to 600 images or PDF pages (100 for models with a 200k-token context window)." 1回のリクエストに画像・PDFを最大600枚まで——という記載です(和訳は当サイトによるもの)。

出典: Claude Platform Docs「Context windows」(2026-09-21確認)・Gemini API 料金ページ(音声トークンの換算、2026-09-21確認)。英語の語数換算は当サイトによる概算です。文字数からトークン数への換算はモデルとトークナイザで変わるため、見積もりは必ず実測値で行ってください(トークン計算機は実測トークン数をそのまま入力する方式です)。

主要モデルの上限値(公式表記のまま)

「1M」は今や特定の1社の専売ではありません。主要どころの上限値を、各社の公式ページの表記どおりに並べます。

プロバイダー / モデル入力の上限出力の上限長文の課金出典(確認日 2026-09-21)
OpenAI
GPT-6 Astra
1,050,000128,000272K超でリクエスト全体が入力2倍・出力1.5倍OpenAI モデルページ
Anthropic
Claude Fable 5 / Sonnet 5 ほか1Mモデル
1,000,000128,000標準単価のまま(追加料金なし)Context windows / Pricing
Google
Gemini 3.1 Pro Preview
1,048,57665,536200K超で全トークンが高い単価Gemini モデルページ / 料金ページ
DeepSeek
deepseek-flash / deepseek-v4-pro
1M384K(最大)公式料金表に長文の段階課金の記載なしModels & Pricing
注目したいのは、Anthropic の書き方です。 公式ドキュメントには「1Mトークンのコンテキストウィンドウを持つモデルでは、1Mが既定値でベータヘッダーは不要。長文リクエストも標準価格で課金される」と明記されています。料金ページにはもっと踏み込んだ一文があります。
"Claude 4.6 and later models and Claude Mythos Preview include the full 1M token context window at standard pricing. (A 900k-token request is billed at the same per-token rate as a 9k-token request.) Prompt caching and batch processing discounts apply at standard rates across the full context window." 1Mのコンテキストを標準価格で含む。900Kトークンのリクエストも9Kトークンと同じ単価——という逐語です(和訳は当サイトによるもの)。つまり Anthropic では、長文だから単価が上がることはありません。プロンプトキャッシュとバッチの割引も、コンテキスト全体に標準レートで適用されると書かれています。

出典: Claude Platform Docs「Pricing」/「Context windows」(いずれも2026-09-21確認)。Anthropic 側の1M対象モデルの逐語列挙は Claude Fable 5.1 / Mythos 5.1 / Fable 5 / Mythos 5 / Opus 5 / Opus 4.8 / Opus 4.7 / Opus 4.6 / Sonnet 5 / Sonnet 4.6 / Mythos Preview です(Sonnet 4.5 など200Kのモデルもあるため、実装時は必ず公式表で確認してください)。

境界線をまたぐと、いくらになるのか(試算)

「リクエスト全体が2倍」というルールは、文章で読むと軽く見えます。金額にするとこうなります。以下はすべて入力トークン数 × 単価の単純試算で、キャッシュ利用・バッチ割引・キャッシュ書込・最低課金は含みません。GPT-6 Astra の通常入力単価は $10 / 100万トークン、272K超では2倍の $20 / 100万トークンです。

入力トークン数適用される単価入力の請求額直前からの増分
272,000標準 $10 / 1M$2.72—
272,100長文 $20 / 1M$5.44+$2.72(約2倍)
500,000長文 $20 / 1M$10.00—
1,000,000長文 $20 / 1M$20.00—
境界線を100トークン超えただけで、入力の請求額が約2倍になります。 100トークンは日本語で数百文字ぶんです。「あと1行足すかどうか」で請求が倍変わる——これが段階課金の意味です。 同じリクエストで出力も発生する場合、出力側にも1.5倍($50 → $75 / 1M)がかかるため、請求総額の差はさらに広がります。入力だけを見れば約2倍ですが、総額の倍率は入力と出力の比率によって変わります。

Google 側も同じ形です。Gemini 3.1 Pro の入力は 200K以下が $2.00 / 1M、200K超が $4.00 / 1M。199,000トークンなら $0.398、201,000トークンなら $0.804(いずれも当サイトの単純計算)で、やはり超えた分だけでなく全体の単価が上がります。
Google 側の脚注の逐語: "If a query input context is longer than 200K tokens, all tokens (input and output) are charged at long context rates." 入力コンテキストが200Kトークンを超えると、すべてのトークン(入力も出力も)が長文の単価で課金される——という脚注です(和訳は当サイトによるもの)。表の「$2.00, prompts <= 200k tokens / $4.00, prompts > 200k tokens」という書き方と合わせて読むと、超えた分だけではなく、そのリクエストの全体が高い単価に移るという設計だと分かります。出力側も同じ扱い($12 → $18)です。

単価の出典: OpenAI モデルページ(逐語: "Prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request.")・Gemini API 料金ページ(2026-09-21確認)。Google の脚注は Google Cloud(Generative AI の料金ページ)の逐語です(2026-09-21確認。ページ内では「200K tokens より長い場合」と記載。Google 側はページや提供経路によって「200K 超」と「200K 以上」で表記が揺れるため、実際の請求前に利用する API・リージョンの料金表をご確認ください)。金額は当サイトの単純計算(入力トークン数 × 単価)で、キャッシュ利用・バッチ割引・キャッシュ書込は含みません。272K という境界値は GPT-6 Astra 固有のもので、OpenAI の全モデル共通ではありません。モデルごとに公式ページで確認してください。

もう1つの落とし穴 — 会話が伸びると入力が積み上がる

上限に届かなくても、費用は静かに増えます。APIは基本的にステートレス(サーバー側が会話を覚えていない)ため、毎回、会話の最初から全部を送り直す必要があるからです。

条件値
固定の前置き(システムプロンプト+資料)8,000トークン
1往復ごとに増える量3,000トークン
往復数10往復
単価(GPT-6 Astra・キャッシュなし)$10 / 1M
10往復で、送った入力の合計は245,000トークン($2.45)になります。 内訳は 8,000×10 + 3,000×(1+2+…+10) = 80,000 + 165,000 = 245,000。 実際に新しい情報として増えたのは 8,000 + 3,000×10 = 38,000トークン($0.38)だけです。6倍以上を「同じ前置きの再送」に払っている計算になります。

しかもこの増え方は往復数の二乗で効いてきます。100往復なら送る入力の合計は1,595万トークン($159.50)です。1Mの上限に一度も触れていないのに、です。

対策は「減らす」と「キャッシュする」の2つです。本当に必要な部分だけを渡す、そして変わらない前置きはプロンプトキャッシュに載せる。同じ前置きを繰り返し送る使い方では、キャッシュの有無が請求額を大きく変えます(仕組みと単価差は第2回の解説にまとめています)。

金額は当サイトの単純計算です(入力トークン数の合計 × 単価)。実際の課金ではプロンプトキャッシュ・バッチ割引・キャッシュ書込の料金が別途適用されるため、金額は上限側の目安としてお読みください。なお Anthropic は公式にコンテキスト圧縮(context compaction、ベータ)を用意しており、「会話が上限に近づくと古いコンテキストを自動要約し、実効的なコンテキスト長を増やす」と説明しています(Anthropic 公式発表、2026-09-21確認)。上限に近づいたら要約して畳む、という設計も各社で進んでいます。

3つめの落とし穴 — 「入る」と「均等に使える」は別

上限いっぱいまで入れれば、その全部を使ってくれるのでしょうか。長い入力を与えるほど性能が不安定になるという結果が公表されています。Chroma が2025年7月に公開した技術レポート「Context Rot(コンテキスト腐敗)」は、18モデル(GPT-4.1、Claude 4、Gemini 2.5、Qwen3 など)を対象に検証しています。

"models do not use their context uniformly; instead, their performance grows increasingly unreliable as input length grows." モデルはコンテキストを均一には使わず、入力が長くなるほど性能は不安定になる——という報告です(英文逐語。和訳は当サイトによるもの)。「100万トークン」は、性能が出る100万トークンという約束ではありません。
実験条件結果(同レポート)
LongMemEval
(長い会話から答える)
全文入力 113,000トークン と、関係する部分だけを抜いた約300トークンを比較「全モデルで、絞った入力のほうが大幅に高い性能」。無関係な文脈を足すことが、検索のステップを1つ増やすことになるため
邪魔者(distractor)の影響正解の周りに、紛らわしい記述を0〜4個置く「邪魔者が1つでもあれば性能は下がり、4つ重なるとさらに悪化する」。しかも邪魔者ごとに影響度が違う
文章の並び順論理的な流れを保った文章 vs 文をランダムに入れ替えた文章「入れ替えたほうが成績が良い」という直感に反する結果。「モデルは文脈の論理的な流れに敏感に反応する」ため
繰り返し語の再現同じ語を25〜10,000語並べ、1語だけ違う語を混ぜて正確に写させる入力が長くなるほど全モデルで一貫して性能が低下。位置が後ろになるほど正しく置けない
レポートの結論は「どう見せるか」の話です。 "Whether relevant information is present in a model's context is not all that matters; what matters more is how that information is presented." 必要な情報が入っているかどうかより、どう見せているかのほうが重要——という一文です(和訳は当サイトによるもの)。「大きいから入れておく」は、精度の面でも得とは限りません。

出典: Chroma「Context Rot: How Increasing Input Tokens Impacts LLM Performance」(2026-09-21確認)。この検証は2025年7月時点のモデル(GPT-4.1・Claude 4・Gemini 2.5・Qwen3 世代)で行われたものです。2026年9月時点の最新モデルで同じ傾向が同じ強さで出るかは、当サイトでは確認できていません。当時の結果として読んでください。

図で整理 — 上限・課金の境界・実効的な使いやすさは別物

1Mコンテキストの3つの数字: 入力の上限(GPT-6 Astra 1,050,000トークン)、長文課金の境界(272K超でリクエスト全体が入力2倍)、そして実際に精度が出る範囲はさらに狭い。境界をまたぐと金額が跳ね上がる 「1M」とひとことで言っても、3つの線がある 例: GPT-6 Astra(入力上限 1,050,000 / 長文境界 272K / 出力上限 128,000) 標準単価 長文単価(リクエスト全体が入力2倍・出力1.5倍) 272K の境界 ここを1トークン超えると全体が2倍 1,050,000 入力の物理的な上限 精度が安定しやすい範囲(目安) 入力が長くなるほど性能は不安定になる(Chroma, 2025年7月・18モデル) 同じ 113,000 トークンでも、全文を渡すより必要な部分(約300トークン)だけを渡したほうが「大幅に高い性能」。 邪魔者が1つ入るだけで下がり、4つでさらに悪化する。 出典: OpenAI モデルページ / Ai.google.dev 料金ページ / Anthropic Context windows / Chroma Context Rot(確認日 2026-09-21) 数値は各社公表値と当サイトの整理。精度の範囲は概念図で、具体的なしきい値を示すものではありません。
上段の帯は課金の境界、下段は精度の傾向を示す概念図(安全な上限を示すものではありません)です。上限まで入れられることと、その範囲で同じ品質が出ることは別です。境界値はモデルごとに異なるため、必ず各社の公式ページで確認してください。

生活に置き換えると — 大きな机と、荷物の重さ

「1Mコンテキスト」は、巨大な机を貸してもらうようなものです。ただし荷物を積めば積むほど、必要な書類を探し出すのが遅くなります。 さらに厄介なのは、机の広さと運賃が連動している点です。ある荷物量を超えると、「その分だけ」ではなく「今回の荷物ぜんぶ」の運賃が倍になる——これが OpenAI や Google の段階課金です。 Anthropic は「机が広くなっても運賃は同じ」という方式です。同じ「1M」でも、料金の設計思想が違うということです。
生活での例コンテキストウィンドウでの対応物
机の広さ入力の上限(1Mトークンなど)
机に置ける荷物の総量システムプロンプト+会話履歴+資料+ツール出力の合計
運賃が跳ねる重さの境目長文課金の境界(272K / 200K など)
机は広いのに探しものが出てこない長い入力で精度が不安定になる現象(context rot)
毎回ぜんぶ持ってくるステートレスなAPIでは入力が毎回まるごと課金対象になる

この比喩で持ち帰ってほしいのは1点です。「広い机=たくさん積めば得」ではありません。積む量・積み方・運賃の境目の3つをセットで見るのが、コンテキストの設計です。

実務では、どう使うか

長い入力を設計するときの3つの確認

  • 長文の境界はどこか、超えたら「全体」か「超過分」か — GPT-6 Astra は 272K超でリクエスト全体が入力2倍・出力1.5倍。Gemini は 200K超で全トークンが高い単価。Anthropic は1Mまで標準単価。ここを取り違えると見積もりが倍以上ずれます。
  • 本当に全部を渡す必要があるか — 113,000トークンの全文入力と、必要な約300トークンだけの入力を比べた実験では、後者が大幅に上でした。検索で絞ってから渡すほうが、安くて精度も高い、という方向です。
  • 繰り返し送る前置きはキャッシュに載っているか — 10往復で$2.45のうち大半は「同じ前置きの再送」でした。変わらない部分はプロンプトキャッシュに載せるのが基本です。
  • 上限値だけを見てプランを決めない。同じ「1M」でも、長文の課金ルール・出力の上限・キャッシュの扱いが違います。3社を横並びで比較するなら料金比較と合わせて読んでください。
  • 自社のタスクで確かめる。長文ベンチの代表格である Needle in a Haystack(長い文書に1つだけ事実を埋めて探させる形式)は単純な検索のテストで、実務の「曖昧な指示を解釈する」負荷を再現しません。点数が高くても、自分の用途で同じとは限りません。
  • 「上限に近づいたら畳む」設計も選択肢。Anthropic は会話が上限に近づくと古いコンテキストを自動要約する仕組み(コンテキスト圧縮、ベータ)を案内しています。満杯まで積む前提で組むより、要約して捨てる前提のほうが安定する場合があります。
  • 数字は必ず単価表とセットで確認してください。本記事の金額はすべて当サイトの単純計算です。割引(キャッシュ・バッチ)やキャッシュ書込の料金を入れると実額は変わります。

まとめ — ひと言でいうと

1Mコンテキストは「容量」の話。料金と精度は別の話

  • 1M=100万トークンは、英語で約75万語、音声なら約11時間ぶんの目安。日本語は同じ文でもトークン数が多くなります。
  • 長文の課金ルールは3社で大きく異なります。OpenAI は272K超でリクエスト全体が入力2倍・出力1.5倍、Google は200K超で全トークンが高い単価、Anthropic は1Mでも標準単価。
  • 境界線をまたぐと金額が跳ねます。272,000トークン $2.72 → 272,100トークン $5.44(GPT-6 Astra、当サイト試算)。
  • しかも上限に届かなくても費用は増えます。10往復で送る入力は合計245,000トークン、実際に増えたのは38,000トークンぶんだけ。
  • そして「入る」=「均等に使える」ではありません。長い入力ほど性能は不安定になる、という検証結果が公開されています。

この用語がいちばん誤解されやすいのは、「1M」という上限の数字だけが独り歩きする点です。実際に効いてくるのは、その上限の手前にある課金の境界線と、その上限よりずっと手前にある精度の限界のほうです。次に「1Mコンテキスト対応」という文字を見たら、単価表の段差と、キャッシュの扱いを確認してみてください。

次に読む

前置きを繰り返し送るときの単価差は第2回(プロンプトキャッシュ)に、ベンチ数値の読み方は第1回(ベンチ数値の読み方)にまとめています。実際の単価は料金比較で確認できます。

🧪 用語説明の一覧へ →

用語説明 ・ プロンプトキャッシュ ・ ベンチ数値の読み方 ・ 料金比較 ・ トークン計算機

⚠️ 免責事項

  • 単価・上限値・引用は2026-09-21に一次情報(OpenAI / Google / Anthropic / DeepSeek の公式ページ)で確認したものです。料金と仕様は予告なく変わります。契約前に必ず各社公式ページをご確認ください。
  • 金額の試算はすべて当サイトによる単純計算(トークン数 × 単価)で、キャッシュ利用・バッチ割引・キャッシュ書込・最低課金は含みません。実際の請求額とは異なります。
  • 長文で性能が不安定になるという検証結果は、Chroma が2025年7月に公開したレポート(18モデル、当時のGPT-4.1・Claude 4・Gemini 2.5・Qwen3 世代)によるものです。2026年9月時点の最新モデルで同じ傾向が同じ強さで出るかは確認できていません。
  • 272K などの境界値はモデルごとに異なります。本文の数値を他モデルに当てはめないでください。
  • 公式の英文は逐語で引用し、和訳は当サイトによるものです。原文と和訳が食い違う場合は原文を優先してください。
  • 本サイトは各社と提携しておらず、特定プロバイダーの推薦・代理ではありません。