ベンチマークとは — 「誰が・何を・どう測るか」で仕分ける

用語説明 第5回。今回のテーマは ベンチマーク です。 きっかけは読者からの素直な疑問でした——「開発者による実測では、DeepSWE、GDPval-AA、Terminal-bench、OSWorld など複数のベンチマーク」と書いてあっても、誰が具体的に何を計測しているのか分からない。ベンチマークが多すぎて訳が分からない。 そこでこのページでは、ベンチ名を暗記するのをやめます。代わりに①誰が運営しているか ②何を測っているか ③どう測るか(ハーネス・設定)という3つの質問で仕分ける道具を持ち帰ってもらいます。 第3回のハーネス(harness)と対になる内容です。

「同じベンチ名でも、運営・版・ハーネス・設定が違えば、数字は比較できない」

このページを貫く一行です。ベンチマークの名前はテストのタイトルにすぎません。同じタイトルでも、出題する人が違い、採点する人が違い、受験者に渡す道具が違えば、点数は別物になります。実際に GDPval と GDPval-AA はデータセットは同じでも、運営と測り方が違うため別の数字として扱う必要があります(後半で詳しく扱います)。

● 最終更新:  |  方針: 運営主体の公式サイト・原論文で確認できた範囲のみ掲載。確認できないものは載せません

なぜ「多すぎて分からない」と感じるのか

理由はシンプルで、ベンチマークは「モデルを比較するため」ではなく「特定の能力を測るため」に、測りたい人がそれぞれ作っているからです。 コーディングを測りたい会社、実務の経済価値を測りたい研究所、ターミナル操作を測りたい大学のグループ——目的が違えば、当然テストの形も違います。 にもかかわらず、ニュースでは全部が「ベンチマークのスコア」という同じ言葉で並べられます。ここで情報が潰れてしまうわけです。

だから覚えるべきはベンチ名の一覧ではなく、「この数字は誰の・何の・どう測った数字か」を引き出す手順です。次の図がその全体像です。

ベンチマークの数字を仕分ける3つの質問 ベンチ名だけでは数字の意味は決まらない。①誰が運営しているか ②何を測っているか ③どう測っているか(ハーネス・設定)の3つを確認して初めて数字の意味が決まる。同じベンチ名でも運営・版・ハーネス・設定が違えば比較できない。 ベンチ名 DeepSWE これはタイトルにすぎない ① 誰が 運営主体 企業か、研究機関か、コミュニティか ② 何を 測っている対象 コード/実務/ターミナル/GUI ③ どう測るか ハーネス・設定 環境・道具・試行回数・判定基準 この3つが決まって、初めて「73%」の意味が決まる 同じベンチ名でも、運営・版(1.0 / 2.0 / Verified など)・ハーネス・設定が違えば、数字は比較できない

← 横にスクロールできます →

ベンチマークの数字を読むときの手順です。ベンチ名は入口にすぎず、意味を決めるのは運営主体・測定対象・測り方の3つです。下段の帯は「注意」ではなく「前提条件」——数字を語る際には、この4点(運営・版・ハーネス・設定)を必ずセットで添える必要があります。
この記事のゴール: 読み終わったときに、ニュースで「モデルAはベンチマークXで73%」と見ても、 「誰が運営するXの、どの版を、どんなハーネスで走らせた73%なのか」を自分で確認できるようになること。数字を信じる/疑うの前に、出どころを特定できる状態を目指します。

6つのベンチを3つの質問で仕分ける

よく並べて語られる6つを、同じフォーマットで整理しました。全部、運営主体の公式リポジトリ・公式サイト・原論文で確認した内容です(確認日 2026年9月23日)。

ベンチマーク① 誰が(運営)② 何を(測定対象)③ どう測るか(ハーネス・判定)
DeepSWE Datacurve(datacurve-ai) ソフトウェアエンジニアリング。長い工程(long-horizon)のコーディング作業 113タスク・5言語(TypeScript / Go / Python / JavaScript / Rust)。分離環境でエージェントを走らせ、プログラムベースの検証器で採点。タスクは既存のマージ済みPRからの流用ではなく書き下ろし(学習データ汚染への対策)
GDPval OpenAI 実務の経済価値があるタスク(44職種 / 米GDP上位9セクター) 1,320タスク。成果物は文書・スライド・図表・表計算など。参照ファイルと文脈が添付される。人間の専門家によるブラインドのペアワイズ比較で採点
GDPval-AA Artificial Analysis GDPval と同じデータセット(OpenAIのGDPval)を、別の運営が別の測り方で v2.1。シェルアクセスとWeb閲覧を渡したエージェントループ(Stirrup)で解かせ、Eloレーティングで順位化
Terminal-Bench Harbor + Laude Institute ターミナル(コマンドライン)での操作・作業 分離コンテナ内でエージェントが実シェルを操作し、停止後に検証スイートを実行。全テスト通過のときだけ「解決」と判定され、スコアは解決タスクの割合。継続型でタグ付きリリースを公開
Terminal-Bench-Science Stanford + Laude Institute(コミュニティ型) 科学研究の実務ワークフロー(生命・物理・地球・数理・工学) 専門家が作成・レビューした70タスク。判定はタスクの著者自身が書いた検証テスト。1タスクあたり8時間のエージェント枠という長い設定
OSWorld XLANG Lab(香港大学)ほか GUI・OS操作(実際のPC上でのオフィス作業) VM上の実コンピュータ環境で369タスク。各タスクが「初期状態のセットアップ」と「実行ベースの評価スクリプト」を持つ

※ 表中の数値・構成はいずれも運営主体の一次資料に基づきます。ただし各ベンチのタスク数は版によって変わります(例: Terminal-Benchは2.0で89タスク、OSWorldは1.0で369タスク、2.0では108タスク)。数字を引用するときは版までセットで書いてください。

1つずつ、「誰が・何を・どう測るか」を確認する

上の表を、運営主体の一次情報でたどり直します。逐語(原文の英語)と当サイトの解釈は書き分けています。

DeepSWE — 「既存の正解」を排除したコーディング測定

運営: Datacurve(GitHub org: datacurve-ai)

公式の説明(逐語)
"DeepSWE is a benchmark for measuring frontier coding agents on original, long-horizon software engineering tasks drawn from active open-source repositories. The benchmark includes 113 tasks across TypeScript, Go, Python, JavaScript, and Rust, with isolated environments and program-based verifiers." — github.com/datacurve-ai/deep-swe(2026-09-23確認)
何を測っているか
「実際のオープンソースリポジトリで、長い工程のソフトウェアエンジニアリング作業をやり切れるか」です。1問1答の知識ではなく、複数ファイルにまたがる実装・修正を扱います。
どう測るか(ここが要点)
タスクは書き下ろしで、既存のマージ済みプルリクエストから流用していません。つまりモデルが学習中に答えを見ている可能性を減らしているのが設計の主眼です(汚染対策)。採点は特定の模範解答との一致ではなく、振る舞いを確認する手書きの検証器で行います。Datacurve はこの検証器と人間の採点者の不一致率が 1.4% だったと報告しており、これは隠れたテストスイートとの一致で採点する方式(同社の比較では SWE-bench Pro で 32.4%)より小さい数字です。
混同しやすい別物
「DeepSWE-Preview」はこのベンチマークとは別物です。あちらは Agentica と Together AI が公開した 32B のオープンウェイトモデル(コーディングエージェント用)で、ベンチマークの名前ではありません。「DeepSWE」で検索すると両方が出てくるので、ベンチマークの話かモデルの話かを最初に切り分ける必要があります。

出典: GitHub datacurve-ai/deep-swe · VentureBeat 報道 · DeepSWE-Preview の説明(別物)

GDPval — 「人がお金を払う仕事」を測る

運営: OpenAI

何を測っているか
学術的な試験問題ではなく、実務の成果物です。原論文は「米GDP上位9セクター・44職種をカバーし、大半の米国労働統計局の作業活動を包含する」と説明しています。成果物は文書・スライド・図表・スプレッドシート・マルチメディアに及び、単純なテキストプロンプトではなく参照ファイルと文脈が添付される点が特徴です。
どう測るか
1,320タスク。品質・速度・コストを人間の専門家との比較で評価し、採点は専門家によるブラインドのペアワイズ比較で行います。220タスクのゴールドサブセットが公開され、自動採点サービスも提供されています(evals.openai.com)。
注意点(OpenAI自身の記載)
原論文は「GDPvalは初期段階であり、多くの経済的タスクのニュアンスを反映していない」と明記しています。また現行版は1回限り(one-shot)の設計で、複数回の下書きを通じて改善するケースは捉えられません。

出典: openai.com/index/gdpval · 原論文 arXiv:2510.04374(初版 2025年10月5日) · OpenAI Evals

GDPval-AA — 同じデータセットの「別の測り方」

運営: Artificial Analysis(データセットは OpenAI の GDPval)

ここが「訳が分からない」の正体
名前が似ているので同じものだと思われがちですが、運営も測り方も別です。データセットだけが共通で、走らせ方が違います。Artificial Analysis の説明(逐語)は "GDPval-AA v2.1 is Artificial Analysis' evaluation framework for OpenAI's GDPval dataset" です。
どう測るか
同社は "Models are given shell access and web browsing capabilities in an agentic loop via Stirrup to solve tasks, with Elo ratings derived from blind pairwise comparisons." と説明しています。つまりシェルとWeb閲覧を渡したエージェントループでタスクを解かせ、ブラインドのペア比較からEloを出します。OpenAI 側が人間の専門家の採点を使うのに対し、こちらはエージェントに道具を渡してEloで並べる——同じタスクでも測っている構図が違います。
だから何が言えるか
「GDPval と GDPval-AA のスコアを並べて優劣を語る」ことはできません。データセットが同じでさえ、運営とハーネスが違えば数字の意味は別です。これがこのページの中心メッセージの実例です。

出典: artificialanalysis.ai — GDPval-AA v2.1(2026-09-23確認)

Terminal-Bench — ターミナルで「やり切れたか」を測る

運営: Harbor + Laude Institute(プロジェクトリード: Ryan Marten)

何を測っているか
コマンドライン上で完結する作業を、エージェントが最後まで実行できるかです。原論文(Terminal-Bench 2.0)は「実ワークフローに着想を得た、難しく厳選された89タスク」と説明しています。
どう測るか
タスクは分離されたコンテナの中で、自然言語の指示から始まります。エージェントは実シェルを操作し、出力を見て、必要なら何度でもやり直せます。エージェントが止まった後に検証スイートを最終状態に対して実行し、すべての検証テストが通ったときだけ「解決」と数えます。スコアは解決したタスクの割合です。
つまり単発の生成物ではなく、エラーから回復する力・ドキュメントを読む力・想定外の出力に適応する力がそのまま点数に出ます。
版に注意
継続型のベンチマークで、タグ付きリリースが公開され続けています。「Terminal-Benchで○%」と書くときは版(2.0 / 2.1 / 4.0 など)まで添える必要があります。

出典: GitHub harbor-framework/terminal-bench("Terminal-Bench is hosted by Harbor and Laude Institute.") · 原論文 arXiv:2601.11868

Terminal-Bench-Science — 「研究者の実務」に振り切った派生版

運営: Stanford + Laude Institute(コミュニティ型)。主導: Steven Dillmann・Sanmi Koyejo・Ludwig Schmidt ほか

何を測っているか
一般のターミナル操作ではなく、科学研究の実務ワークフローです。生命・物理・地球・数理・工学の5領域にわたります。公式リポジトリは "Terminal-Bench-Science currently contains 70 expert-curated tasks across five broad scientific domains and is growing toward 100+ tasks." と記載しています。
どう測るか
タスクは領域の専門家が作成し、レビューします。採点はそのタスクの著者自身が書いた検証テストです。第三者ベンチマークを回した評価では、Terminal-Bench 2.1 が1タスクあたり15〜60分のエージェント枠であるのに対し、こちらは1タスクに8時間の枠が与えられ、最大4 vCPU・16GBまで要求できるとされています。「同じTerminal-Benchの名前がついていても、測っている難易度と時間スケールが別物」という好例です。
だから何が言えるか
汎用のコーディング能力が高くても、科学的ワークフローでは伸びしがたい——という「テストが違えば順位も変わる」ことを示す指標として読むのが適切です。

出典: GitHub harbor-framework/terminal-bench-science · Snorkel AI(主導メンバー) · vals.ai(実行条件)

OSWorld — 「本物のPC」でGUIを操作できるか

運営: XLANG Lab(香港大学)ほか(Salesforce Research・CMU・University of Waterloo が参加)

何を測っているか
テキストやコードではなく、実際のコンピュータ上のGUI操作です。公式サイトの記載(逐語)は "We also create a benchmark of 369 real-world computer tasks in OSWorld with reliable, reproducible setup and evaluation scripts." です。
どう測るか
VM上の実環境でタスクを実行します。各タスクは「詳細な初期状態のセットアップ」と「実行ベースの評価スクリプト」を持ち、判定はエージェントの操作後の状態に対して機械的に行われます。
原論文が示した水準は、人間が72.36%以上を達成できる一方、当時の最良モデルは12.24%——主な失敗要因はGUIの接地(grounding)と操作知識でした。(この数値は原論文=2024年時点の測定であり、現在のモデルの水準ではありません。)
版に注意
公式サイトは「8つのGoogle Driveタスクはネットワーク依存のため手動設定が必要、もしくは除外可能(361タスク)」と注記しています。また OSWorld-Verified では300件以上の不具合が修正され、OSWorld 2.0 は108タスク・7職域の長horizon版として別に公開されています。1.0の369タスクと2.0の108タスクは別物です。

出典: osworld-v1.xlang.ai · 原論文 arXiv:2404.07972(NeurIPS 2024) · OSWorld-Verified · OSWorld 2.0

次にベンチの数字を見たら、この5つを確認する

暗記は不要です。この順番で確認するだけで、数字の重みが変わります。

  1. 誰が運営しているか — モデルを作った会社自身か、第三者か。自己申告の数値と第三者計測の数値は、同じ「73%」でも意味が違います。
  2. どの版か — 1.0 / 2.0 / Verified / v2.1 などの版が違えば、タスクの母集団が違います。版を書いていないスコアは、そもそも比較の土台に載せられません。
  3. 何を測っているか — コードか、実務の成果物か、ターミナル操作か、GUI操作か。測っていない能力について、そのスコアは何も語りません。
  4. どう測ったか(ハーネスと設定) — エージェントに何を渡したか、試行回数、時間制限、判定が「振る舞い」か「模範解答との一致」か。ここが違うと同じモデル・同じベンチでもスコアが動きます(ハーネス参照)。
  5. 数字が何を数えているか — 「達成率」なのか「Eloレーティング」なのか。Eloは相対順位、達成率は絶対値で、足し算も引き算もできません。

💡 このサイトでの扱い

LLM Data Hub では、モデルを紹介するときも「誰のハーネスでの結果か」まで書く方針を取っています。ベンチマークのスコアを並べるだけの表は作りません。また、集計サイトがミラーした数値や検索スニペット由来の伝聞は、事実として扱いません。第1回(GPT-6 Astra のベンチマークの読み方)で扱った「Standard harness 62.7%」と「Provider Adapter 99.9%」が、まさにこの問題の実例です。

関連する用語説明

🧰

ハーネス(harness)とは — 同じモデルでもベンチの数字が変わる理由

このページの③「どう測るか」を掘り下げた回です。ハーネスは「モデル以外の全部」。システムプロンプト・ツール・記憶・サンドボックス・試行回数・採点まで含み、同じモデル・同じベンチでもスコアを動かします。このページとセットで読むと、③の判定基準が具体的になります。

解説を読む →
🧪

GPT-6 Astra「ARC-AGI-3 99.9%・ExploitBench 100%」の読み方

同じベンチでも中立ハーネスでは62.7%(ARC Prize公表)。満点は「もう測れない」の合図です。未飽和のベンチがいちばん情報量が多い理由を、実例で確認できます。

解説を読む →
📏

1Mコンテキストとは — 100万トークンで何が入るか、いくらになるか

ベンチマークと同じく「数字の読み方」がテーマ。長文の課金ルールは3社で大きく異なり、境界を100トークン超えただけで請求が2倍になる例もあります。

解説を読む →

出典一覧(すべて2026年9月23日確認)

関連: 用語説明 一覧 · ハーネス(harness) · GPT-6 Astra のベンチマークの読み方 · 1Mコンテキスト · リリース年表