ベンチマークを運営している組織 — 「誰が測ったか」を見分ける4つの手順

用語説明 第6回。第5回の「ベンチマークとは」では、ベンチ名を①誰が運営しているか ②何を測っているか ③どう測るか(ハーネス・設定)の3つで仕分ける道具をお渡ししました。 今回はその①「誰が運営しているか」をもう一段掘ります。数字を見ても運営組織の名前が出てこない、公式サイトに行っても運営主体が書いていない——という読者の声がきっかけです。 ベンチ名から運営組織にたどり着く手順を4ステップに固定し、代表的なベンチの運営元を一覧にしました。

「そのベンチは誰のものか」を決めているのは、スコアを出す人ではなく、テストを配っている人です。同じテストでも、配る人が変われば別のベンチになります。 本ページでは、テストや評価フレームワークを作成・配布・版管理している主体を「運営元」と呼びます(データセット作成者・ハーネス提供者・スコア報告者が別々のこともあります)。

実際に GDPval と GDPval-AA はデータセットが同じでも運営が別(OpenAI と Artificial Analysis)で、別の数字として扱われます。第5回で扱ったのと同じ構図です。今回の4手順を使えば、初見のベンチ名でも5分で運営元にたどり着けます。

● 最終更新:  |  方針: 運営主体は公式サイト・原論文・公式リポジトリで確認できたもののみ掲載。確認できないものは「要確認」と明記します

手順 — ベンチ名から運営組織にたどり着く4ステップ

  1. ベンチ名で原論文か公式リポジトリを探す。検索して出てくるまとめ記事は使わず、原論文(arXiv等)か公式リポジトリ(GitHub)を開きます。リポジトリのオーナー名が、そのまま運営組織の手がかりです。
    例: DeepSWE → github.com/datacurve-ai/deep-swe → オーナーは datacurve-ai = Datacurve
  2. 運営組織が「何者か」を確かめる。モデルベンダー(OpenAI・Anthropicなど)、独立評価機関(Artificial Analysis・ARC Prizeなど)、研究機関(大学・非営利)、業務ソフト企業(Zapier・Cursorなど)のどれかに分類します。ここで利害関係の距離が見えます。
  3. スコアを報告しているのは誰かを確認する。同じベンチでも「運営組織が発表」「モデルベンダーが自社setupで発表」「第三者が引用」の3通りがあります。ベンダーの発表ページに as reported by OpenAI のような注記があれば、その数値はベンダー自身の測定値です。
  4. ハーネス(テストを走らせる道具)の提供元を確認する。ハーネスがモデルベンダー製か第三者製かで条件が変わります。詳細は第3回「ハーネス」を参照。ここまで読んで初めて、数字の比較可能性が判断できます。

💡 5分で終わらせるコツ

  • リポジトリのオーナー名(datacurve-ai、harbor-framework、xlang など)は組織の短縮名です。そのまま検索すると公式サイトに着きます。
  • ベンチ名に組織名が入っているものは探す必要がありません(GDPval-AA の AA=Artificial Analysis、AutomationBench は Zapier が自社ブログで公表)。
  • 逆に、組織名が入っていないベンチほど運営元が分かりにくいので、手順1を必ず踏んでください。

図: 誰が配り、誰が走らせ、誰が報告するか

ベンチマークの役割分担 ベンチマークの運営組織、ハーネス提供元、スコア報告者の3つの役割を矢印で示した図。運営組織がテストを配り、ハーネス提供元が実行環境を用意し、報告者が数値を公表する。 ① 運営組織 テスト(問題・採点基準)を 作り、配り、版を管理する Datacurve / XLANG Lab Zapier / ARC Prize など ② ハーネス提供元 モデルを実際に走らせる 道具・環境を用意する Claude Code / 自社setup ベンダー製が多い=要注意 ③ 報告者 出た数値を公表する (運営元/ベンダー/第三者) ここが違うと比較できない 「同一ベンチで比較」と言えるのは、①②③が揃っているときだけ 例: AutomationBench は ①Zapier ②Zapier ③Zapier …だが OpenAI の比較表にも登場(条件は同じとは限らない)
当サイト作成。役割分担の考え方であり、各ベンチの実測条件を示すものではありません。

代表例 — ベンチと運営組織

2026年9月のモデル発表(Claude Opus 5.5・GPT-6 Sol/Luna)で実際に登場したベンチを中心に、運営元・分類・確認できた一次情報をまとめました。

ベンチマーク運営組織分類一次情報
DeepSWE / DeepSWE 1.1Datacurve独立評価公式リポジトリ(オーナー: datacurve-ai)
Terminal-Bench 4.0Harbor + Laude Institute研究機関系公式リポジトリ / 原論文
Terminal-Bench-Science 0.1Stanford + Laude Institute研究機関系公式リポジトリ
OSWorld / OSWorld 2.0XLANG Lab研究機関系公式サイト / 原論文
GDPvalOpenAIモデルベンダー公式ページ / 原論文
GDPval-AA v2.1Artificial Analysis独立評価公式ページ(データセットはGDPvalと共通・運営は別)
AutomationBench 1.0.6Zapier業務ソフト企業公式ページ。OpenAIの比較表にも「Zapierが実施」と明記
FrontierCode 1.1Cognition開発ツール企業公式ページ(OpenAI発表のリンク先)
CursorBench 4.0Cursor開発ツール企業Anthropic・OpenAI 双方の比較表に登場。運営組織の公式解説ページは要確認
Agents' Last Exam V1agents-last-exam.org(公式ドメイン。運営法人名は未確認)独立評価公式サイト
ARC-AGI-3ARC Prize独立評価(非営利)arcprize.org(中立ハーネスでの公表値を当サイトの第1回で扱っています)
WANDRPerplexityAI企業Anthropicが独自条件で実行しており「Perplexityの公開setupとは異なり、スコアは直接比較できない」と公式注記つき

※ 出典: 各ベンチの公式サイト・公式リポジトリ、および Anthropic「Introducing Claude Opus 5.5」/OpenAI「Introducing GPT-6 Sol and Luna」の注記(2026-09-25確認)。 CursorBenchの運営元公式ページは確認できていないため「要確認」としています。

実例で見る「運営組織の違いが数字に効く」3パターン

パターン1: 同じデータセット、別運営 → 別の数字

GDPval(OpenAI) vs GDPval-AA(Artificial Analysis)

何が違うのか
データセットは共通でも、運営(採点の設計・モデルの走らせ方)が別。Claude Opus 5.5 の発表では GDPval-AA v2.1 が使われ、Eloスコアとして 1,846(Opus 5.5)/1,735(Fable 5.1)/1,708(Opus 5)が並びます。
読み方
「GDPval」で検索して出てきた数字と、発表記事の「GDPval-AA」の数字は別物です。接尾辞(-AA、-Verified、v2.1など)まで含めて検索してください。

パターン2: 運営元は第三者、でも条件はベンダー側

AutomationBench(Zapier)

何が違うのか
ベンチの運営も実施もZapierです。ただしOpenAIの比較表では「実行時にフォールバックモデルを使わなかった」条件が明記されています。セーフガードによる介入が「失敗」として扱われるため、実際より低いスコアになります。さらにOpenAIはClaude Fable 5.1の値が実際のコストを過小評価している(Opus 5へのフォールバック費が約40%のタスクで発生しているのに含まれていない)とも注記しています。
読み方
「第三者が運営している=公平」ではありません。誰が走らせ、どんな制約で走らせたかまで読む必要があります。

パターン3: ベンチは自社製、素材は他社製

WANDR(Perplexity)

何が違うのか
AnthropicはPerplexityのベンチを独自条件(オフライン版のweb検索・web fetch、programmatic tool calling、コード実行、980kトークンのタスク予算)で実行し、「Perplexityの公開setupとは異なるためスコアは直接比較できない」と明記しています。そのうえで同じ条件で測ったモデル同士だけを並べています。
読み方
これは誠実な注記の例です。「比較できない」と書いてある表は、書いていない表より信頼できます。逆に、条件の記述がない比較表は比較できない可能性を疑ってください。

チェックリスト — 発表記事の数字を見たら

  1. ベンチ名に組織名が入っているか?入っていなければ、原論文・公式リポジトリまで戻って運営元を確認。
  2. 運営組織はモデルベンダーか、第三者か?ベンダー自身が運営するベンチは、他社モデルを同じ条件で測りにくい構造です。
  3. 「as reported by 〜」の注記はないか?あるならその数値はそのベンダーの測定値で、発表元が測り直したものではありません。
  4. ハーネスは誰のものか?ベンダー製ハーネス(例: Claude Code)での計測は、そのベンダーに有利になり得ます。
  5. 比較相手の世代は揃っているか?OpenAIは公式注記で「Fable 5.1のスコアが入手できない場合はFable 5の値を報告した」と明言しています。世代が混在した表は横並びにできません。
  6. 「比較できない」と書いてあるか?条件が違うことの明示は減点ではなく加点です。

出典一覧(すべて2026年9月25日確認)

関連: 用語説明 一覧 · ベンチマークとは(第5回) · ハーネス(第3回) · Claude Opus 5.5 詳細 · GPT-6 Sol / Luna 詳細 · リリース年表

⚠️ この記事の限界

  • 運営組織は2026年9月25日時点で公式サイト・原論文・公式リポジトリから確認できた情報です。ベンチの移管・改名・版更新で変わることがあります。
  • 分類(独立評価/研究機関系/業務ソフト企業など)は当サイトの整理で、業界の公式分類ではありません。
  • 各ベンチのスコアや測定条件そのものは本ページでは扱いません。数値は各モデルの詳細ページをご覧ください。
  • 本サイトは特定プロバイダーと提携していません。