GPT-6 Astra「ARC-AGI-3 99.9%・ExploitBench 100%」の読み方

用語説明 第1回。ニュースやリリースノートの一行を、一次情報まで戻って分解します。 今日の一行は GPT-6 Astra のこれです。数字は正しい。ただし条件が書かれていない。 そこを読み解かないと、この一行は意思決定に使えません。

「ARC-AGI-3 99.9%・ExploitBench 100%・Terminal-Bench Science 64.6%。1.05Mコンテキスト・128K出力」

対象: GPT-6 Astra(OpenAI / 2026-09-03発表 / $10・$50 per 1M tokens)— 詳細ページ ・ リリース年表 の記載と一致

● 最終更新:  |  一次情報: OpenAI公式発表・ARC Prize公式ブログ・OpenAI Model Docs・Terminal-Bench-Science 0.1  |  確認日: 2026-09-15

まず5つの数字に分解する

この一行は、性質のまったく違う5つの数字を並べています。同じ「%」でも、意味は3種類に分かれます。

ARC-AGI-3
99.9%
未知の環境を探索して目標そのものを獲得する「インタラクティブ推論」。ベンチ自体が飽和
ExploitBench
100.0%
実在ソフトウェアの脆弱性を実際に動くエクスプロイトにできるか。満点=天井
Terminal-Bench Science 0.1
64.6%
研究者が実際に行った科学ワークフロー70件。まだ未飽和
コンテキストウィンドウ
1,050,000
一度に読める上限。272Kトークン超はリクエスト全体が入力2倍
最大出力
128,000
一度に書き出せる上限。使い切ると1リクエスト$6.40

つまり「99.9%」は飽和したベンチの数字、「100%」は天井に当たった数字、「64.6%」はまだ伸びしろのある数字です。同じ並びに見えて、情報量はまったく違います。

① 同じベンチ、違う土俵 — 99.9%と62.7%

結論: ARC-AGI-3 の数字は「どのハーネス(実行環境)で測ったか」まで読まないと比較できません。 OpenAIの発表は 99.9%。ベンチマークを運営する ARC Prize 自身が公表した中立ハーネスでの値は 62.7% です。どちらも同じモデルの、同じベンチのスコアです。
条件スコアコスト中身
Standard harness(中立)62.7%$26,098モデルが「持ち越すノート」を自分で選ぶ。全モデル共通の最小インターフェース
Provider Adapter harness(OpenAI側)99.9%約$19K非公開の推論状態をリクエスト間で保持し、長い会話は compaction で圧縮

出典: ARC Prize「OpenAI's GPT-6 Astra on ARC-AGI-3」・ARC-AGI Results(個別ページ)(2026-09-15確認)。OpenAI公式発表にも「ARC-AGI-3 は responses API ハーネスで実行し、現実の性能に合わせて2つの設定を変更した」と注記があります。

この差は何を意味するのか

  • 同条件で比較できる数字は 62.7% vs GPT-5.6 Sol 7.8%。これでも約8倍の跳ね上がりで、ARC Prizeは「インタラクティブ推論における段階的な能力変化」と評価しています。派手な99.9%と7.8%を並べるのは、土俵が違う数字の比較です。
  • ARC Prizeは今後、両ハーネスの結果をラベル付きでリーダーボードに併記すると明言。つまり「ハーネスを明記しないスコアは読めない」というのがベンチ運営者の公式見解です。
  • 差の中身はソフトウェア側の設計。Provider Adapter では集計実時間が約3.66倍速く、両ハーネスが解いた167ペアでトークンが49%減りました。同じモデルでも、推論状態を持ち越せるランタイムでは結果が変わります。自分のシステムが推論状態を保持できるかを確認せずに99.9%を当てにすると、期待を裏切られます。
  • ARC Prizeは「このベンチを飽和させたことはAGIの証明ではない」と明言。ベンチを運営する側が結論を留保している点は、素直に重く読むべきです。

補足: ARC-AGI-3 は ARC Prize Foundation が2026-03-25に公開した初のインタラクティブ推論ベンチで、指示もルールも与えられない環境でエージェントが目標を獲得し、世界モデルを構築できるかを測ります。公開時はフロンティアモデルが軒並み1%未満、人間は全環境を解いていました(ARC-AGI-3 公式)。

② 満点は「強い」ではなく「もう測れない」— ExploitBench 100%

結論: 100%は「他を圧倒した」ではなく「測定上限に到達した」という意味です。 ExploitBench は、実在ソフトウェアの脆弱性を見つけて実際に動くエクスプロイトに落とせるかを測るサイバー評価。Astra は満点(Sol 78.5%、Claude Fable 5.1 70%)で、これ以上差が付きません。
  • 満点を取ったモデルの次に強いモデルは、同じベンチでは区別できません。次の比較軸は ExploitGym(Astra 42.4% / Sol 30.3%)や、後述の新規ベンチに移ります。ベンチの数字が消えるのは、能力が伸びたときだけではありません。
  • 汚染(学習データへの露出)の懸念が、ベンダー自身から出ています。過去の脆弱性に触れている可能性があるため、OpenAIは新規ベンチ2本でも評価を実施。満点の数字はこの留保つきで読む必要があります。
  • OpenAIはこのモデルを Preparedness Framework で初めて「Critical」に分類しました。高度なサイバー能力は開放ではなく、アクセス制限(gated access)付きで提供されます。「最高性能」と「誰でも使える」は別の話です。

出典: OpenAI公式発表(GPT-6 Astra)(2026-09-15確認)。評価は両モデルとも本番セーフガード無しで実施、との注記があります。

③ 未飽和のベンチがいちばん情報量が多い — Terminal-Bench Science 64.6%

結論: 64.6% は「まだ誰も解き切っていない」ベンチの数字です。伸びしろと、導入判断の両方に使えます。 Terminal-Bench-Science 0.1 は、Stanford大学が主導し、Terminal-Bench / Harbor チームと各分野の専門家が作った科学ワークフローのベンチ。専門家が投稿・査読した70ワークフローを5領域(生命・物理・地球・数理・工学)で評価し、各タスク3試行、成果物(解析・シミュレーション・証明・コード・データ)で採点します。
モデルTB-Science 0.1(OpenAI公表)中立リーダーボード(参照時点)
GPT-6 Astra64.6%—
Claude Fable 5.152.6%—
GPT-5.6 Sol22.4%22.4%
Claude Opus 5(中立条件のトップ)—30.0%
  • OpenAI公表の64.6%は、OpenAI側の条件での値です。中立の公開リーダーボードのスナップショットでは、トップでも Claude Opus 5 の 30.0%。同じベンチでこれだけ違えば、数字だけを横並びにしても意味がありません。①で見た「土俵の問題」は、ここでも起きます。
  • それでもこのベンチは難しく、だから使える数字です。一般のコーディング系ベンチで80%超を取るモデルでも、実際の科学ワークフローでは大半を落とします。つまり上位の差がそのまま能力差として現れ、飽和していない。
  • OpenAIは低コスト設定の値も公表しています。Terminal-Bench Science 61.1%(約27%低コスト)、GPQA Diamond 94.9%(約37%低コスト)。推論エフォートを下げてもすぐには壊れない、という主張です(自己申告値)。

出典: OpenAI公式発表・Terminal-Bench-Science 0.1 発表・GitHub(体制・仕様)・中立リーダーボードのミラー(BenchLM、2026-09時点のスナップショット)(2026-09-15確認)。

ARC-AGI-3: 同じモデル・同じベンチマーク — 標準ハーネス62.7% / OpenAIのProvider Adapter 99.9% ARC-AGI-3: 同じモデル・同じベンチマーク 違うのはハーネス、変わるのは数字。 標準ハーネス(中立) 62.7% $26,098 Provider Adapter ハーネス(OpenAI) 99.9% ~$19K 0% 50% 100% 出典: ARC Prize (2026-09-03)。両方とも ARC Prize 公表の結果。
同じベンチ・同じモデル・違う数字。ハーネスの違いでこれだけ動きます(出典: ARC Prize)。

④ 「1.05Mコンテキスト」は実務で何を意味するか

結論: 1.05Mは「入る」という話、272K超の2倍ルールは「入れると高い」という話です。 1トークン≒英語0.75語で単純換算すると、1.05Mトークンは約78万語。GPT-6 Astra の仕様(コンテキスト1,050,000 / 最大出力128,000 / 知識カットオフ2026-04-30)は OpenAI Developers のモデルページで確認できます。
使い方料金ルール1リクエストの入力コスト
272Kトークン以下標準レート(入力 $10 / 1M)≤ $2.72
272Kトークン超(境界の外)リクエスト全体が入力・キャッシュ2倍、出力1.5倍1.05M → $21.00
同条件でキャッシュヒット($1.00 / 1M の2倍)キャッシュ読込は入力の10%(ただし2倍ルールは適用)1.05M → $2.10
出力を使い切る(128K × $50 / 1M)出力は入力の5倍単価$6.40(出力側)
  • 境界は272Kトークン、そして「部分適用」ではありません。272Kを1トークンでも超えると、そのリクエスト全体が入力2倍・出力1.5倍。巨大な文脈を1回入れるだけで、入力コストが一気に跳ねます。
  • キャッシュが効くのは「同じ長い前提を何度も使う」ときだけです。キャッシュ読込は入力の10%($1.00 / 1M)、キャッシュ書込は入力の1.25倍($12.50 / 1M)。使い捨ての巨大コンテキストは、キャッシュ設計が無いかぎり最も高い買い物になります。
  • 出力を長くする設計はコストに直撃します。出力$50 / 1Mは入力の5倍。128K出力を使い切れば1リクエスト$6.40で、これは272K以下の入力(最大$2.72)より高くつきます。長文を一括生成させるより、分割して必要な分だけ出させるほうが安く済みます。
  • 「1.05M入る」=「1.05M入れるべき」ではありません。272K以下で設計できるなら定価、超えるなら2倍。この境界が、実務上の設計予算になります。試算はトークン計算機でどうぞ。

出典: OpenAI GPT-6 Astra Model Docs(コンテキスト・最大出力・知識カットオフ・料金ルール、2026-09-15確認)。金額は公表単価からの単純計算で、実際の請求額は入力と出力の合計になります。

この一行の読み方(まとめ)

数字を見たら、まず3つ確認する

  • 誰の土俵か — ベンダー自身のハーネスか、中立のハーネスか。ARC-AGI-3 は 99.9% と 62.7% で別物でした。
  • 天井に当たっているか — 満点・飽和は「差が付かない」状態。次の比較軸(ExploitGym、新規ベンチ)に移る合図です。
  • 同条件で比べた相手がいるか — 条件が違う数字を横に並べても順位は出ません。条件が揃うまで、ベンチは「読める」ようになりません。

この一行の情報量は「99.9%」そのものより、「99.9%と62.7%の差」と「64.6%という未飽和の数字」のほうが大きい。前者は自分のランタイム設計の宿題を、後者は導入判断の材料を示しています。次に新しいモデルの発表を見たら、同じ3点を当ててみてください。

次に読む

数字の条件が分かったら、次はコストです。GPT-6 Astra の料金・提供状況、Claude Fable 5.1 との比較、実際の試算まで。

🧮 トークン計算機で試算する →

GPT-6 Astra · 料金比較 · リリース年表 · DeepSeek V4.1 Flash · プロンプトキャッシュ · 用語説明

⚠️ 免責事項

  • ベンチマーク数値は各ベンチ運営者・開発元の公表値であり、条件(ハーネス・試行回数・エフォート設定)が異なります。本ページは条件の違いを明記する方針で整理しています。
  • 料金・仕様は2026-09-15に各社公式ページで確認したものです。予告なく変動します。契約前に必ず公式ページをご確認ください。
  • 本ページのコスト換算は公表単価に基づく単純計算で、実際の請求額を保証するものではありません。