1Mコンテキストとは — 100万トークンで何が入るか、いくらになるか
用語説明 第4回。今回のテーマは 1Mコンテキスト です。 「100万トークンまで入ります」と書いてあっても、そこには2つの別の話が混ざっています。1つは何が入るのか(容量の話)、もう1つは入れたらいくらになるのか(料金の話)。 そして料金のほうは、OpenAI・Google・Anthropic の3社で設計が大きく違います(OpenAI と Google は境界を超えると全体の単価が上がり、Anthropic は対象の1Mモデルで標準単価のままです)。しかも長く入れれば賢くなるわけでもありません。 数字と出典を並べながら、最後には「自分の使い方だとどうなるか」まで持って帰れる形にします。
「1Mトークンまで入る」=「100万トークンぶん賢く使える」ではない
結論 — 上限は「入る量」、課金は「入れた瞬間のルール」
- OpenAI: 272K(27.2万)トークンを超えると、リクエスト全体が入力2倍・出力1.5倍。超えた分だけではありません。
- Google: 200K(20万)トークンを超えると、すべてのトークンが高い方の単価で課金されます。
- Anthropic: 1Mでも標準単価のまま(900Kのリクエストも9Kと同じ単価、と公式に明記)。
なお、この言葉が料金表で使われるときは3つの数字が紛れ込みがちです。①入力の上限(コンテキストウィンドウ)、②出力の上限(max output tokens)、③長文課金の境界。 たとえば GPT-6 Astra は1,050,000 / 128,000 / 272K の3つが別々に存在します。この記事ではこの3つを区別して扱います。
1Mトークンとは、実際どれくらいか
「100万」と言われても実感がないので、身近な単位に置き換えます。トークンは文字数とは違うので、あくまで目安として見てください。
出典: Claude Platform Docs「Context windows」(2026-09-21確認)・Gemini API 料金ページ(音声トークンの換算、2026-09-21確認)。英語の語数換算は当サイトによる概算です。文字数からトークン数への換算はモデルとトークナイザで変わるため、見積もりは必ず実測値で行ってください(トークン計算機は実測トークン数をそのまま入力する方式です)。
主要モデルの上限値(公式表記のまま)
「1M」は今や特定の1社の専売ではありません。主要どころの上限値を、各社の公式ページの表記どおりに並べます。
| プロバイダー / モデル | 入力の上限 | 出力の上限 | 長文の課金 | 出典(確認日 2026-09-21) |
|---|---|---|---|---|
| OpenAI GPT-6 Astra | 1,050,000 | 128,000 | 272K超でリクエスト全体が入力2倍・出力1.5倍 | OpenAI モデルページ |
| Anthropic Claude Fable 5 / Sonnet 5 ほか1Mモデル | 1,000,000 | 128,000 | 標準単価のまま(追加料金なし) | Context windows / Pricing |
| Google Gemini 3.1 Pro Preview | 1,048,576 | 65,536 | 200K超で全トークンが高い単価 | Gemini モデルページ / 料金ページ |
| DeepSeek deepseek-flash / deepseek-v4-pro | 1M | 384K(最大) | 公式料金表に長文の段階課金の記載なし | Models & Pricing |
出典: Claude Platform Docs「Pricing」/「Context windows」(いずれも2026-09-21確認)。Anthropic 側の1M対象モデルの逐語列挙は Claude Fable 5.1 / Mythos 5.1 / Fable 5 / Mythos 5 / Opus 5 / Opus 4.8 / Opus 4.7 / Opus 4.6 / Sonnet 5 / Sonnet 4.6 / Mythos Preview です(Sonnet 4.5 など200Kのモデルもあるため、実装時は必ず公式表で確認してください)。
境界線をまたぐと、いくらになるのか(試算)
「リクエスト全体が2倍」というルールは、文章で読むと軽く見えます。金額にするとこうなります。以下はすべて入力トークン数 × 単価の単純試算で、キャッシュ利用・バッチ割引・キャッシュ書込・最低課金は含みません。GPT-6 Astra の通常入力単価は $10 / 100万トークン、272K超では2倍の $20 / 100万トークンです。
| 入力トークン数 | 適用される単価 | 入力の請求額 | 直前からの増分 |
|---|---|---|---|
| 272,000 | 標準 $10 / 1M | $2.72 | — |
| 272,100 | 長文 $20 / 1M | $5.44 | +$2.72(約2倍) |
| 500,000 | 長文 $20 / 1M | $10.00 | — |
| 1,000,000 | 長文 $20 / 1M | $20.00 | — |
Google 側も同じ形です。Gemini 3.1 Pro の入力は 200K以下が $2.00 / 1M、200K超が $4.00 / 1M。199,000トークンなら $0.398、201,000トークンなら $0.804(いずれも当サイトの単純計算)で、やはり超えた分だけでなく全体の単価が上がります。
単価の出典: OpenAI モデルページ(逐語: "Prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request.")・Gemini API 料金ページ(2026-09-21確認)。Google の脚注は Google Cloud(Generative AI の料金ページ)の逐語です(2026-09-21確認。ページ内では「200K tokens より長い場合」と記載。Google 側はページや提供経路によって「200K 超」と「200K 以上」で表記が揺れるため、実際の請求前に利用する API・リージョンの料金表をご確認ください)。金額は当サイトの単純計算(入力トークン数 × 単価)で、キャッシュ利用・バッチ割引・キャッシュ書込は含みません。272K という境界値は GPT-6 Astra 固有のもので、OpenAI の全モデル共通ではありません。モデルごとに公式ページで確認してください。
もう1つの落とし穴 — 会話が伸びると入力が積み上がる
上限に届かなくても、費用は静かに増えます。APIは基本的にステートレス(サーバー側が会話を覚えていない)ため、毎回、会話の最初から全部を送り直す必要があるからです。
| 条件 | 値 |
|---|---|
| 固定の前置き(システムプロンプト+資料) | 8,000トークン |
| 1往復ごとに増える量 | 3,000トークン |
| 往復数 | 10往復 |
| 単価(GPT-6 Astra・キャッシュなし) | $10 / 1M |
しかもこの増え方は往復数の二乗で効いてきます。100往復なら送る入力の合計は1,595万トークン($159.50)です。1Mの上限に一度も触れていないのに、です。
対策は「減らす」と「キャッシュする」の2つです。本当に必要な部分だけを渡す、そして変わらない前置きはプロンプトキャッシュに載せる。同じ前置きを繰り返し送る使い方では、キャッシュの有無が請求額を大きく変えます(仕組みと単価差は第2回の解説にまとめています)。
金額は当サイトの単純計算です(入力トークン数の合計 × 単価)。実際の課金ではプロンプトキャッシュ・バッチ割引・キャッシュ書込の料金が別途適用されるため、金額は上限側の目安としてお読みください。なお Anthropic は公式にコンテキスト圧縮(context compaction、ベータ)を用意しており、「会話が上限に近づくと古いコンテキストを自動要約し、実効的なコンテキスト長を増やす」と説明しています(Anthropic 公式発表、2026-09-21確認)。上限に近づいたら要約して畳む、という設計も各社で進んでいます。
3つめの落とし穴 — 「入る」と「均等に使える」は別
上限いっぱいまで入れれば、その全部を使ってくれるのでしょうか。長い入力を与えるほど性能が不安定になるという結果が公表されています。Chroma が2025年7月に公開した技術レポート「Context Rot(コンテキスト腐敗)」は、18モデル(GPT-4.1、Claude 4、Gemini 2.5、Qwen3 など)を対象に検証しています。
| 実験 | 条件 | 結果(同レポート) |
|---|---|---|
| LongMemEval (長い会話から答える) | 全文入力 113,000トークン と、関係する部分だけを抜いた約300トークンを比較 | 「全モデルで、絞った入力のほうが大幅に高い性能」。無関係な文脈を足すことが、検索のステップを1つ増やすことになるため |
| 邪魔者(distractor)の影響 | 正解の周りに、紛らわしい記述を0〜4個置く | 「邪魔者が1つでもあれば性能は下がり、4つ重なるとさらに悪化する」。しかも邪魔者ごとに影響度が違う |
| 文章の並び順 | 論理的な流れを保った文章 vs 文をランダムに入れ替えた文章 | 「入れ替えたほうが成績が良い」という直感に反する結果。「モデルは文脈の論理的な流れに敏感に反応する」ため |
| 繰り返し語の再現 | 同じ語を25〜10,000語並べ、1語だけ違う語を混ぜて正確に写させる | 入力が長くなるほど全モデルで一貫して性能が低下。位置が後ろになるほど正しく置けない |
出典: Chroma「Context Rot: How Increasing Input Tokens Impacts LLM Performance」(2026-09-21確認)。この検証は2025年7月時点のモデル(GPT-4.1・Claude 4・Gemini 2.5・Qwen3 世代)で行われたものです。2026年9月時点の最新モデルで同じ傾向が同じ強さで出るかは、当サイトでは確認できていません。当時の結果として読んでください。
図で整理 — 上限・課金の境界・実効的な使いやすさは別物
生活に置き換えると — 大きな机と、荷物の重さ
| 生活での例 | コンテキストウィンドウでの対応物 |
|---|---|
| 机の広さ | 入力の上限(1Mトークンなど) |
| 机に置ける荷物の総量 | システムプロンプト+会話履歴+資料+ツール出力の合計 |
| 運賃が跳ねる重さの境目 | 長文課金の境界(272K / 200K など) |
| 机は広いのに探しものが出てこない | 長い入力で精度が不安定になる現象(context rot) |
| 毎回ぜんぶ持ってくる | ステートレスなAPIでは入力が毎回まるごと課金対象になる |
この比喩で持ち帰ってほしいのは1点です。「広い机=たくさん積めば得」ではありません。積む量・積み方・運賃の境目の3つをセットで見るのが、コンテキストの設計です。
実務では、どう使うか
長い入力を設計するときの3つの確認
- 長文の境界はどこか、超えたら「全体」か「超過分」か — GPT-6 Astra は 272K超でリクエスト全体が入力2倍・出力1.5倍。Gemini は 200K超で全トークンが高い単価。Anthropic は1Mまで標準単価。ここを取り違えると見積もりが倍以上ずれます。
- 本当に全部を渡す必要があるか — 113,000トークンの全文入力と、必要な約300トークンだけの入力を比べた実験では、後者が大幅に上でした。検索で絞ってから渡すほうが、安くて精度も高い、という方向です。
- 繰り返し送る前置きはキャッシュに載っているか — 10往復で$2.45のうち大半は「同じ前置きの再送」でした。変わらない部分はプロンプトキャッシュに載せるのが基本です。
- 上限値だけを見てプランを決めない。同じ「1M」でも、長文の課金ルール・出力の上限・キャッシュの扱いが違います。3社を横並びで比較するなら料金比較と合わせて読んでください。
- 自社のタスクで確かめる。長文ベンチの代表格である Needle in a Haystack(長い文書に1つだけ事実を埋めて探させる形式)は単純な検索のテストで、実務の「曖昧な指示を解釈する」負荷を再現しません。点数が高くても、自分の用途で同じとは限りません。
- 「上限に近づいたら畳む」設計も選択肢。Anthropic は会話が上限に近づくと古いコンテキストを自動要約する仕組み(コンテキスト圧縮、ベータ)を案内しています。満杯まで積む前提で組むより、要約して捨てる前提のほうが安定する場合があります。
- 数字は必ず単価表とセットで確認してください。本記事の金額はすべて当サイトの単純計算です。割引(キャッシュ・バッチ)やキャッシュ書込の料金を入れると実額は変わります。
まとめ — ひと言でいうと
1Mコンテキストは「容量」の話。料金と精度は別の話
- 1M=100万トークンは、英語で約75万語、音声なら約11時間ぶんの目安。日本語は同じ文でもトークン数が多くなります。
- 長文の課金ルールは3社で大きく異なります。OpenAI は272K超でリクエスト全体が入力2倍・出力1.5倍、Google は200K超で全トークンが高い単価、Anthropic は1Mでも標準単価。
- 境界線をまたぐと金額が跳ねます。272,000トークン $2.72 → 272,100トークン $5.44(GPT-6 Astra、当サイト試算)。
- しかも上限に届かなくても費用は増えます。10往復で送る入力は合計245,000トークン、実際に増えたのは38,000トークンぶんだけ。
- そして「入る」=「均等に使える」ではありません。長い入力ほど性能は不安定になる、という検証結果が公開されています。
この用語がいちばん誤解されやすいのは、「1M」という上限の数字だけが独り歩きする点です。実際に効いてくるのは、その上限の手前にある課金の境界線と、その上限よりずっと手前にある精度の限界のほうです。次に「1Mコンテキスト対応」という文字を見たら、単価表の段差と、キャッシュの扱いを確認してみてください。
次に読む
前置きを繰り返し送るときの単価差は第2回(プロンプトキャッシュ)に、ベンチ数値の読み方は第1回(ベンチ数値の読み方)にまとめています。実際の単価は料金比較で確認できます。
🧪 用語説明の一覧へ →用語説明 ・ プロンプトキャッシュ ・ ベンチ数値の読み方 ・ 料金比較 ・ トークン計算機
⚠️ 免責事項
- 単価・上限値・引用は2026-09-21に一次情報(OpenAI / Google / Anthropic / DeepSeek の公式ページ)で確認したものです。料金と仕様は予告なく変わります。契約前に必ず各社公式ページをご確認ください。
- 金額の試算はすべて当サイトによる単純計算(トークン数 × 単価)で、キャッシュ利用・バッチ割引・キャッシュ書込・最低課金は含みません。実際の請求額とは異なります。
- 長文で性能が不安定になるという検証結果は、Chroma が2025年7月に公開したレポート(18モデル、当時のGPT-4.1・Claude 4・Gemini 2.5・Qwen3 世代)によるものです。2026年9月時点の最新モデルで同じ傾向が同じ強さで出るかは確認できていません。
- 272K などの境界値はモデルごとに異なります。本文の数値を他モデルに当てはめないでください。
- 公式の英文は逐語で引用し、和訳は当サイトによるものです。原文と和訳が食い違う場合は原文を優先してください。
- 本サイトは各社と提携しておらず、特定プロバイダーの推薦・代理ではありません。