ベンチマークを運営している組織 — 「誰が測ったか」を見分ける4つの手順
用語説明 第6回。第5回の「ベンチマークとは」では、ベンチ名を①誰が運営しているか ②何を測っているか ③どう測るか(ハーネス・設定)の3つで仕分ける道具をお渡ししました。 今回はその①「誰が運営しているか」をもう一段掘ります。数字を見ても運営組織の名前が出てこない、公式サイトに行っても運営主体が書いていない——という読者の声がきっかけです。 ベンチ名から運営組織にたどり着く手順を4ステップに固定し、代表的なベンチの運営元を一覧にしました。
「そのベンチは誰のものか」を決めているのは、スコアを出す人ではなく、テストを配っている人です。同じテストでも、配る人が変われば別のベンチになります。 本ページでは、テストや評価フレームワークを作成・配布・版管理している主体を「運営元」と呼びます(データセット作成者・ハーネス提供者・スコア報告者が別々のこともあります)。
手順 — ベンチ名から運営組織にたどり着く4ステップ
- ベンチ名で原論文か公式リポジトリを探す。検索して出てくるまとめ記事は使わず、原論文(arXiv等)か公式リポジトリ(GitHub)を開きます。リポジトリのオーナー名が、そのまま運営組織の手がかりです。
例: DeepSWE → github.com/datacurve-ai/deep-swe → オーナーは datacurve-ai = Datacurve - 運営組織が「何者か」を確かめる。モデルベンダー(OpenAI・Anthropicなど)、独立評価機関(Artificial Analysis・ARC Prizeなど)、研究機関(大学・非営利)、業務ソフト企業(Zapier・Cursorなど)のどれかに分類します。ここで利害関係の距離が見えます。
- スコアを報告しているのは誰かを確認する。同じベンチでも「運営組織が発表」「モデルベンダーが自社setupで発表」「第三者が引用」の3通りがあります。ベンダーの発表ページに as reported by OpenAI のような注記があれば、その数値はベンダー自身の測定値です。
- ハーネス(テストを走らせる道具)の提供元を確認する。ハーネスがモデルベンダー製か第三者製かで条件が変わります。詳細は第3回「ハーネス」を参照。ここまで読んで初めて、数字の比較可能性が判断できます。
💡 5分で終わらせるコツ
- リポジトリのオーナー名(
datacurve-ai、harbor-framework、xlangなど)は組織の短縮名です。そのまま検索すると公式サイトに着きます。 - ベンチ名に組織名が入っているものは探す必要がありません(GDPval-AA の AA=Artificial Analysis、AutomationBench は Zapier が自社ブログで公表)。
- 逆に、組織名が入っていないベンチほど運営元が分かりにくいので、手順1を必ず踏んでください。
図: 誰が配り、誰が走らせ、誰が報告するか
代表例 — ベンチと運営組織
2026年9月のモデル発表(Claude Opus 5.5・GPT-6 Sol/Luna)で実際に登場したベンチを中心に、運営元・分類・確認できた一次情報をまとめました。
| ベンチマーク | 運営組織 | 分類 | 一次情報 |
|---|---|---|---|
| DeepSWE / DeepSWE 1.1 | Datacurve | 独立評価 | 公式リポジトリ(オーナー: datacurve-ai) |
| Terminal-Bench 4.0 | Harbor + Laude Institute | 研究機関系 | 公式リポジトリ / 原論文 |
| Terminal-Bench-Science 0.1 | Stanford + Laude Institute | 研究機関系 | 公式リポジトリ |
| OSWorld / OSWorld 2.0 | XLANG Lab | 研究機関系 | 公式サイト / 原論文 |
| GDPval | OpenAI | モデルベンダー | 公式ページ / 原論文 |
| GDPval-AA v2.1 | Artificial Analysis | 独立評価 | 公式ページ(データセットはGDPvalと共通・運営は別) |
| AutomationBench 1.0.6 | Zapier | 業務ソフト企業 | 公式ページ。OpenAIの比較表にも「Zapierが実施」と明記 |
| FrontierCode 1.1 | Cognition | 開発ツール企業 | 公式ページ(OpenAI発表のリンク先) |
| CursorBench 4.0 | Cursor | 開発ツール企業 | Anthropic・OpenAI 双方の比較表に登場。運営組織の公式解説ページは要確認 |
| Agents' Last Exam V1 | agents-last-exam.org(公式ドメイン。運営法人名は未確認) | 独立評価 | 公式サイト |
| ARC-AGI-3 | ARC Prize | 独立評価(非営利) | arcprize.org(中立ハーネスでの公表値を当サイトの第1回で扱っています) |
| WANDR | Perplexity | AI企業 | Anthropicが独自条件で実行しており「Perplexityの公開setupとは異なり、スコアは直接比較できない」と公式注記つき |
※ 出典: 各ベンチの公式サイト・公式リポジトリ、および Anthropic「Introducing Claude Opus 5.5」/OpenAI「Introducing GPT-6 Sol and Luna」の注記(2026-09-25確認)。 CursorBenchの運営元公式ページは確認できていないため「要確認」としています。
実例で見る「運営組織の違いが数字に効く」3パターン
パターン1: 同じデータセット、別運営 → 別の数字
GDPval(OpenAI) vs GDPval-AA(Artificial Analysis)
- 何が違うのか
- データセットは共通でも、運営(採点の設計・モデルの走らせ方)が別。Claude Opus 5.5 の発表では GDPval-AA v2.1 が使われ、Eloスコアとして 1,846(Opus 5.5)/1,735(Fable 5.1)/1,708(Opus 5)が並びます。
- 読み方
- 「GDPval」で検索して出てきた数字と、発表記事の「GDPval-AA」の数字は別物です。接尾辞(-AA、-Verified、v2.1など)まで含めて検索してください。
パターン2: 運営元は第三者、でも条件はベンダー側
AutomationBench(Zapier)
- 何が違うのか
- ベンチの運営も実施もZapierです。ただしOpenAIの比較表では「実行時にフォールバックモデルを使わなかった」条件が明記されています。セーフガードによる介入が「失敗」として扱われるため、実際より低いスコアになります。さらにOpenAIはClaude Fable 5.1の値が実際のコストを過小評価している(Opus 5へのフォールバック費が約40%のタスクで発生しているのに含まれていない)とも注記しています。
- 読み方
- 「第三者が運営している=公平」ではありません。誰が走らせ、どんな制約で走らせたかまで読む必要があります。
パターン3: ベンチは自社製、素材は他社製
WANDR(Perplexity)
- 何が違うのか
- AnthropicはPerplexityのベンチを独自条件(オフライン版のweb検索・web fetch、programmatic tool calling、コード実行、980kトークンのタスク予算)で実行し、「Perplexityの公開setupとは異なるためスコアは直接比較できない」と明記しています。そのうえで同じ条件で測ったモデル同士だけを並べています。
- 読み方
- これは誠実な注記の例です。「比較できない」と書いてある表は、書いていない表より信頼できます。逆に、条件の記述がない比較表は比較できない可能性を疑ってください。
チェックリスト — 発表記事の数字を見たら
- ベンチ名に組織名が入っているか?入っていなければ、原論文・公式リポジトリまで戻って運営元を確認。
- 運営組織はモデルベンダーか、第三者か?ベンダー自身が運営するベンチは、他社モデルを同じ条件で測りにくい構造です。
- 「as reported by 〜」の注記はないか?あるならその数値はそのベンダーの測定値で、発表元が測り直したものではありません。
- ハーネスは誰のものか?ベンダー製ハーネス(例: Claude Code)での計測は、そのベンダーに有利になり得ます。
- 比較相手の世代は揃っているか?OpenAIは公式注記で「Fable 5.1のスコアが入手できない場合はFable 5の値を報告した」と明言しています。世代が混在した表は横並びにできません。
- 「比較できない」と書いてあるか?条件が違うことの明示は減点ではなく加点です。
出典一覧(すべて2026年9月25日確認)
- Anthropic「Introducing Claude Opus 5.5」 — anthropic.com/claude-opus-5-5(ベンチ表の脚注1〜4)
- OpenAI「Introducing GPT-6 Sol and Luna」 — openai.com/index/introducing-gpt-6-sol-and-luna(各ベンチ節の注記)
- DeepSWE — github.com/datacurve-ai/deep-swe(運営: Datacurve)
- Terminal-Bench — github.com/harbor-framework/terminal-bench(Harbor + Laude Institute)
- OSWorld — osworld-v2.xlang.ai(XLANG Lab)
- GDPval — openai.com/index/gdpval(OpenAI)/ GDPval-AA — artificialanalysis.ai/evaluations/gdpval-aa(Artificial Analysis)
- AutomationBench — zapier.com/benchmarks(Zapier)
- FrontierCode — cognition.com/frontiercode(Cognition)
- Agents' Last Exam — agents-last-exam.org
- ARC-AGI-3 — arcprize.org(ARC Prize)
関連: 用語説明 一覧 · ベンチマークとは(第5回) · ハーネス(第3回) · Claude Opus 5.5 詳細 · GPT-6 Sol / Luna 詳細 · リリース年表
⚠️ この記事の限界
- 運営組織は2026年9月25日時点で公式サイト・原論文・公式リポジトリから確認できた情報です。ベンチの移管・改名・版更新で変わることがあります。
- 分類(独立評価/研究機関系/業務ソフト企業など)は当サイトの整理で、業界の公式分類ではありません。
- 各ベンチのスコアや測定条件そのものは本ページでは扱いません。数値は各モデルの詳細ページをご覧ください。
- 本サイトは特定プロバイダーと提携していません。