GPT-6 Astra「ARC-AGI-3 99.9%・ExploitBench 100%」の読み方
用語説明 第1回。ニュースやリリースノートの一行を、一次情報まで戻って分解します。 今日の一行は GPT-6 Astra のこれです。数字は正しい。ただし条件が書かれていない。 そこを読み解かないと、この一行は意思決定に使えません。
「ARC-AGI-3 99.9%・ExploitBench 100%・Terminal-Bench Science 64.6%。1.05Mコンテキスト・128K出力」
まず5つの数字に分解する
この一行は、性質のまったく違う5つの数字を並べています。同じ「%」でも、意味は3種類に分かれます。
つまり「99.9%」は飽和したベンチの数字、「100%」は天井に当たった数字、「64.6%」はまだ伸びしろのある数字です。同じ並びに見えて、情報量はまったく違います。
① 同じベンチ、違う土俵 — 99.9%と62.7%
| 条件 | スコア | コスト | 中身 |
|---|---|---|---|
| Standard harness(中立) | 62.7% | $26,098 | モデルが「持ち越すノート」を自分で選ぶ。全モデル共通の最小インターフェース |
| Provider Adapter harness(OpenAI側) | 99.9% | 約$19K | 非公開の推論状態をリクエスト間で保持し、長い会話は compaction で圧縮 |
出典: ARC Prize「OpenAI's GPT-6 Astra on ARC-AGI-3」・ARC-AGI Results(個別ページ)(2026-09-15確認)。OpenAI公式発表にも「ARC-AGI-3 は responses API ハーネスで実行し、現実の性能に合わせて2つの設定を変更した」と注記があります。
この差は何を意味するのか
- 同条件で比較できる数字は 62.7% vs GPT-5.6 Sol 7.8%。これでも約8倍の跳ね上がりで、ARC Prizeは「インタラクティブ推論における段階的な能力変化」と評価しています。派手な99.9%と7.8%を並べるのは、土俵が違う数字の比較です。
- ARC Prizeは今後、両ハーネスの結果をラベル付きでリーダーボードに併記すると明言。つまり「ハーネスを明記しないスコアは読めない」というのがベンチ運営者の公式見解です。
- 差の中身はソフトウェア側の設計。Provider Adapter では集計実時間が約3.66倍速く、両ハーネスが解いた167ペアでトークンが49%減りました。同じモデルでも、推論状態を持ち越せるランタイムでは結果が変わります。自分のシステムが推論状態を保持できるかを確認せずに99.9%を当てにすると、期待を裏切られます。
- ARC Prizeは「このベンチを飽和させたことはAGIの証明ではない」と明言。ベンチを運営する側が結論を留保している点は、素直に重く読むべきです。
補足: ARC-AGI-3 は ARC Prize Foundation が2026-03-25に公開した初のインタラクティブ推論ベンチで、指示もルールも与えられない環境でエージェントが目標を獲得し、世界モデルを構築できるかを測ります。公開時はフロンティアモデルが軒並み1%未満、人間は全環境を解いていました(ARC-AGI-3 公式)。
② 満点は「強い」ではなく「もう測れない」— ExploitBench 100%
- 満点を取ったモデルの次に強いモデルは、同じベンチでは区別できません。次の比較軸は ExploitGym(Astra 42.4% / Sol 30.3%)や、後述の新規ベンチに移ります。ベンチの数字が消えるのは、能力が伸びたときだけではありません。
- 汚染(学習データへの露出)の懸念が、ベンダー自身から出ています。過去の脆弱性に触れている可能性があるため、OpenAIは新規ベンチ2本でも評価を実施。満点の数字はこの留保つきで読む必要があります。
- OpenAIはこのモデルを Preparedness Framework で初めて「Critical」に分類しました。高度なサイバー能力は開放ではなく、アクセス制限(gated access)付きで提供されます。「最高性能」と「誰でも使える」は別の話です。
出典: OpenAI公式発表(GPT-6 Astra)(2026-09-15確認)。評価は両モデルとも本番セーフガード無しで実施、との注記があります。
③ 未飽和のベンチがいちばん情報量が多い — Terminal-Bench Science 64.6%
| モデル | TB-Science 0.1(OpenAI公表) | 中立リーダーボード(参照時点) |
|---|---|---|
| GPT-6 Astra | 64.6% | — |
| Claude Fable 5.1 | 52.6% | — |
| GPT-5.6 Sol | 22.4% | 22.4% |
| Claude Opus 5(中立条件のトップ) | — | 30.0% |
- OpenAI公表の64.6%は、OpenAI側の条件での値です。中立の公開リーダーボードのスナップショットでは、トップでも Claude Opus 5 の 30.0%。同じベンチでこれだけ違えば、数字だけを横並びにしても意味がありません。①で見た「土俵の問題」は、ここでも起きます。
- それでもこのベンチは難しく、だから使える数字です。一般のコーディング系ベンチで80%超を取るモデルでも、実際の科学ワークフローでは大半を落とします。つまり上位の差がそのまま能力差として現れ、飽和していない。
- OpenAIは低コスト設定の値も公表しています。Terminal-Bench Science 61.1%(約27%低コスト)、GPQA Diamond 94.9%(約37%低コスト)。推論エフォートを下げてもすぐには壊れない、という主張です(自己申告値)。
出典: OpenAI公式発表・Terminal-Bench-Science 0.1 発表・GitHub(体制・仕様)・中立リーダーボードのミラー(BenchLM、2026-09時点のスナップショット)(2026-09-15確認)。
④ 「1.05Mコンテキスト」は実務で何を意味するか
| 使い方 | 料金ルール | 1リクエストの入力コスト |
|---|---|---|
| 272Kトークン以下 | 標準レート(入力 $10 / 1M) | ≤ $2.72 |
| 272Kトークン超(境界の外) | リクエスト全体が入力・キャッシュ2倍、出力1.5倍 | 1.05M → $21.00 |
| 同条件でキャッシュヒット($1.00 / 1M の2倍) | キャッシュ読込は入力の10%(ただし2倍ルールは適用) | 1.05M → $2.10 |
| 出力を使い切る(128K × $50 / 1M) | 出力は入力の5倍単価 | $6.40(出力側) |
- 境界は272Kトークン、そして「部分適用」ではありません。272Kを1トークンでも超えると、そのリクエスト全体が入力2倍・出力1.5倍。巨大な文脈を1回入れるだけで、入力コストが一気に跳ねます。
- キャッシュが効くのは「同じ長い前提を何度も使う」ときだけです。キャッシュ読込は入力の10%($1.00 / 1M)、キャッシュ書込は入力の1.25倍($12.50 / 1M)。使い捨ての巨大コンテキストは、キャッシュ設計が無いかぎり最も高い買い物になります。
- 出力を長くする設計はコストに直撃します。出力$50 / 1Mは入力の5倍。128K出力を使い切れば1リクエスト$6.40で、これは272K以下の入力(最大$2.72)より高くつきます。長文を一括生成させるより、分割して必要な分だけ出させるほうが安く済みます。
- 「1.05M入る」=「1.05M入れるべき」ではありません。272K以下で設計できるなら定価、超えるなら2倍。この境界が、実務上の設計予算になります。試算はトークン計算機でどうぞ。
出典: OpenAI GPT-6 Astra Model Docs(コンテキスト・最大出力・知識カットオフ・料金ルール、2026-09-15確認)。金額は公表単価からの単純計算で、実際の請求額は入力と出力の合計になります。
この一行の読み方(まとめ)
数字を見たら、まず3つ確認する
- 誰の土俵か — ベンダー自身のハーネスか、中立のハーネスか。ARC-AGI-3 は 99.9% と 62.7% で別物でした。
- 天井に当たっているか — 満点・飽和は「差が付かない」状態。次の比較軸(ExploitGym、新規ベンチ)に移る合図です。
- 同条件で比べた相手がいるか — 条件が違う数字を横に並べても順位は出ません。条件が揃うまで、ベンチは「読める」ようになりません。
この一行の情報量は「99.9%」そのものより、「99.9%と62.7%の差」と「64.6%という未飽和の数字」のほうが大きい。前者は自分のランタイム設計の宿題を、後者は導入判断の材料を示しています。次に新しいモデルの発表を見たら、同じ3点を当ててみてください。
次に読む
数字の条件が分かったら、次はコストです。GPT-6 Astra の料金・提供状況、Claude Fable 5.1 との比較、実際の試算まで。
🧮 トークン計算機で試算する →GPT-6 Astra · 料金比較 · リリース年表 · DeepSeek V4.1 Flash · プロンプトキャッシュ · 用語説明
⚠️ 免責事項
- ベンチマーク数値は各ベンチ運営者・開発元の公表値であり、条件(ハーネス・試行回数・エフォート設定)が異なります。本ページは条件の違いを明記する方針で整理しています。
- 料金・仕様は2026-09-15に各社公式ページで確認したものです。予告なく変動します。契約前に必ず公式ページをご確認ください。
- 本ページのコスト換算は公表単価に基づく単純計算で、実際の請求額を保証するものではありません。