ハーネス(harness)とは — 「モデルを動かす側」の総体

用語説明 第3回。今回のテーマは ハーネス(harness) です。 第1回で扱った「同じベンチでも Standard harness(中立的な条件)では62.7%」という一行——なぜ同じモデル・同じベンチなのに、数字が変わるのか。 その答えがこの言葉に入っています。用語の定義から始めて、最後には「次にベンチの数字を見たときに何を確認すればいいか」まで持って帰れる形にします。

「Agent = Model + Harness」

出典: DeepSeek Harness 公式ページ(2026-09-19確認)。DeepSeek が自社のエージェント基盤 DeepSeek Harness のキャッチコピーとして置いている一行です。つまり「エージェント = モデル + ハーネス」。モデルだけではエージェントにならない、という宣言です。

● 最終更新:  |  一次情報: DeepSeek Harness・ARC Prize(GPT-6 Astra on ARC-AGI-3)  |  確認日: 2026-09-19

結論 — ハーネスは「モデル以外の全部」

ハーネスとは、モデルを実際に働かせるために外側に用意する足回りの総体です。 システムプロンプト、渡すツール、何回まで試させるか、どんなサンドボックスで動かすか、前の会話をどう持ち越すか、そしてその結果をどう採点するかまで含みます。 モデルの重み(学習済みのパラメータ)は1つも変えないのに、この足回りだけでベンチのスコアは大きく動きます。

なお、ハーネスは料金(APIの単価)そのものを変える話ではありません。単価は各社の料金表で決まり、ハーネスは「同じ単価で何ができるか(スコア・速度・トークン消費)」に効く設計の話です。 エンジニアリングの現場では「モデルを替える」「プロンプトを直す」が話題になりがちですが、実際に数字を動かしているのはその外側の設計であることが多い——だからこの言葉が単独の用語として使われます。 「どのモデルか」だけでなく「どのハーネスか」まで言わないと、性能の話が噛み合わないのです。

まずイメージ — モデルは「頭脳」、ハーネスは「身体・道具・段取り」

DeepSeek の公式ページは、この関係を短い一文で書いています。

"The model is the soul of an agent." / "A harness lets an agent understand its environment, use tools, and keep working in real-world settings." モデルはエージェントの魂(中身)。そしてハーネスは、そのエージェントが環境を理解し、ツールを使い、実世界で動き続けられるようにするもの——という説明です。
※ 公式ページの英文逐語。和訳は当サイトによるものです。
モデル
頭脳
考える力そのもの。重みは学習で決まり、こちらでは変えられない
ハーネス
身体・道具・段取り
何を見せ、何を使わせ、何回試させ、どう数えるか。ここは設計できる
だから数字が動く
同じ頭脳でも
走るコースと審判が違えば、記録は変わる

ハーネスに入っているもの(公式の一覧)

「足回り」と言われても幅が広すぎるので、実際に何が入っているかを見ます。DeepSeek Harness の公式ページは、エージェントの能力はすべてプラグインとして実装されると説明し、具体的な項目を挙げています。

"Plugins provide every agent capability, including models, tools, skills, sessions, sandboxes, storage, loops, scheduling, and the UI." プラグインが、モデル・ツール・スキル・セッション・サンドボックス・ストレージ・ループ・スケジューリング・UI というエージェントの能力すべてを提供する——という記載です(英文逐語。和訳は当サイトによるもの)。
ハーネスの構成要素何を決めているか数字が動く理由
システムプロンプトモデルに何を見せ、どんな役割と制約を与えるか同じモデルでも、指示が変われば方針が変わる
ツール使える外部機能(ファイル編集・シェル・検索・API など)道具が増えれば解ける問題が増える。減らせば測る条件が変わる
スキル・手順作業の型(チェックリスト・定型手順)を先に与えるか手順が与えられると、探索のムダが減る
セッション・記憶前のやり取りや中間結果をどう持ち越すか持ち越せる前提の設計なら、長い課題でも精度が落ちにくい
サンドボックスどの環境で実行するか(隔離・権限・ネットワーク)環境が違えば試せる操作そのものが変わる
ループ・試行回数何回まで考え直させ・やり直させるか回数を増やせば成功率は上がる。上限は結果に直結する
スケジューリング複数の処理やサブエージェントをどう順序立てるか段取り次第で完了までの時間と手数が変わる
記録(ログ)入力・推論・ツール呼び出しをどう保存するか再現できなければ、改善も検証もできない
採点・評価結果をどう数えるか(正解判定・部分点・打ち切り)数え方が変われば、同じ実行でもスコアが変わる

上段の引用以外の項目は、DeepSeek Harness の公式記載(models / tools / skills / sessions / sandboxes / storage / loops / scheduling / UI)を日本語で整理したものです。「採点・評価」はベンチマークを実施する側の設計要素として当サイトが補足しました(DeepSeek Harness の記載項目ではありません)。

なぜ数字が変わるのか — ARC-AGI-3 の実例(測定条件つき)

抽象論だと腹落ちしないので、実例を1つ見ます。同じモデル(GPT-6 Astra)・同じベンチマーク(ARC-AGI-3)で、ハーネス条件が異なる2つの公表値です。ただしモデル設定も Astra (max) と Astra (high) で異なります。したがって、62.7% と 99.9% の差をハーネスだけの効果と断定することはできません。

ハーネス(測定条件)モデル設定スコアコスト何をしているか
Standard harness
(ARC Prize の中立ハーネス=全モデル共通の最小インターフェース)
Astra (max)62.7%$26Kモデルが持ち越すノートを自分で選ぶ。全モデル共通の最小インターフェース
Provider Adapter harness
(OpenAI 側のハーネス)
Astra (high)99.9%$19Kリクエストをまたいで非公開の推論状態(reasoning state)を保持し、長い会話は圧縮する
Standard harness(中立)の逐語: "Standard harness enables a model to carry forward notes it chooses to keep with it throughout the environment." Provider Adapter harness の逐語: "The Provider Adapter harness preserves opaque reasoning state between requests and uses compaction for longer conversations, allowing the model to reuse prior work." ※ いずれも ARC Prize ブログ(2026-09-19確認)の英文逐語。和訳は当サイトによるもの。
差の中身は「何を持ち越せるか」です。 Standard harness(中立)は、モデルが自分で選んだノートだけを持ち越します。一方の Provider Adapter は、リクエストをまたいで推論状態そのものを保持し、長い会話は圧縮して再利用します。 モデルの重みは同じでも、持ち越せる記憶の量と質が違います——これが 62.7% と 99.9% を分けた主な条件差です(ただしモデル設定も max / high で異なるため、差のすべてがハーネス起因と断定はできません)。
  • どちらも「その条件での」最高値です。ARC Prize は両方を SOTA(最先端)と扱っています。片方が誇張で片方が正しい、という話ではありません。
  • 同条件で比べられる相手も公表されています。ARC Prize は同じ Standard harness 上での比較として GPT-5.6 Sol 7.8% も示しています(2026-09-15確認)。同じ土俵で見れば約8倍の差で、これも大きな前進です。条件の違う 99.9% と 7.8% を並べると、比較の意味が失われます。
  • ベンチ運営者自身が「条件をラベルで明記する」と宣言しています。下記の逐語のとおりです。
"Going forward, we will report both Standard harness and Provider Adapter harness results on the ARC-AGI leaderboard, with each evaluation condition clearly labeled." 今後は ARC-AGI のリーダーボードに両方のハーネスの結果を、評価条件をラベル付けして併記する——という宣言です(ARC Prize ブログ、2026-09-19確認)。当サイトの解釈では、ハーネス名の書かれていないスコアは比較条件を判断しにくいため、数字を見るときは「どの構成の結果か」まで確認したいところです。

出典: ARC Prize「OpenAI's GPT-6 Astra on ARC-AGI-3」(2026-09-19確認)・ARC-AGI Results(個別ページ)。スコアとコストは ARC Prize 公表値で、当サイトによる再計算ではありません。同じハーネスアーキテクチャの背景は第1回の解説も参照してください。

具体的には何のこと? — DeepSeek Harness という実物

「ハーネス」は概念名なので、実物があったほうが分かります。DeepSeek は DeepSeek Harness というエージェント基盤を developer preview(開発者プレビュー)で公開しており、ソースコードも同時に公開されています。公式ページに書かれている範囲で、何を提供するツールなのかを見てみます。

公式ページの記載意味
すべてがプラグインモデル・ツール・スキル・セッション・サンドボックス・ストレージ・ループ・スケジューリング・UI が、差し替え・組み替えできる部品として提供される
Cordis カーネルプラグインの装着・取り外し・依存関係を管理する中核。エージェントの能力はプラグイン側に住む
設定で組み替えソースコードを変えずに、構成ファイルの指定だけで能力を選ぶ・入れ替える・拡張できる
実行の記録モデルが見たもの(システムプロンプト・推論・ツール呼び出しと結果・サブエージェントの割り当て・コンテキスト注入)が追記専用のセッションログに全部残る。再開・分岐・検索・再生が同じ記録の上で動く

実行モードが4つある — ここが「ハーネス差」の実物

公式ページには実行モードが4つ載っています。同じモデルを使っても、渡す道具立てを変えれば測定条件が変わることを、ベンダー自身が機能として用意している形です。

Standard mode
全部入り
ファイル編集・シェル・ファイル/Web検索・スキル・計画・ゴール・サブエージェント・ワークフロー
Code mode
コードで束ねる
Standard の能力を SDK 経由で公開し、モデルが TypeScript プログラム1本に多段の操作をまとめる
Minimal mode
2ツールだけ
シェルとファイル編集の2つだけ。公式ページは「最小環境でモデルをベンチマークするため」と明記
Creator mode
ハーネスを作る
Standard の能力に加えて、実行時の中身の検査・プラグインの実験・プリセット作成の支援
注目すべきは Minimal mode の存在です。 DeepSeek は公式ページで、Minimal mode を「最小環境でモデルをベンチマークするため(for benchmarking models in a minimal environment)」と説明しています。つまりツールを絞った状態で測るモードが、ハーネス側の機能として用意されている。 「ハーネスを変えれば数字が変わる」というのは、批判ではなく前提として扱われている、ということです。

出典: DeepSeek Harness 公式ページ(2026-09-19確認、developer preview)。本文中の英語は公式ページの逐語、日本語は当サイトによる整理です。リポジトリは github.com/deepseek-ai/deepseek-harness。当サイトは DeepSeek と提携しておらず、特定製品の推薦ではありません。

図で整理 — モデルの外側がハーネス

ハーネスの構成: 中央のモデル(頭脳)の外側に、システムプロンプト・ツール・スキル・記憶・サンドボックス・試行回数といった足回りが並ぶ。同じモデルでもこの外側が変われば結果は変わる(例: ARC-AGI-3 で Standard harness 62.7%(モデル設定 max)、Provider Adapter harness 99.9%(モデル設定 high)) ハーネス = モデルの外側の足回り 同じモデル(頭脳)でも、外側の部品が変われば結果は変わる ハーネス(モデルの外側・ここを設計できる) システムプロンプト ツール・検索 スキル・手順 モデル(頭脳) ここは同じ 記憶・セッション サンドボックス 試行回数・ループ この外側には、採点・評価(どう数えるか)も含まれます。 例: ARC-AGI-3 — Standard 62.7% (max) / Provider Adapter 99.9% (high)、いずれも ARC Prize 公表値
中央のモデルは変えられませんが、その外側(ハーネス)は設計できます。構成要素は DeepSeek Harness 公式ページの記載項目をもとに整理しました。スコアは ARC Prize 公表値で、Standard harness はモデル設定 max、Provider Adapter harness は high と条件が異なります。

生活に置き換えると — 同じ選手でも、点数は変わる

同じ選手が試合に出ても、コート・審判・ルール解釈が違えば点数は変わります。 選手の実力(=モデル)は同じ。けれど、コートの広さ、使える道具、審判が何をファウルと取るか、交代のルール——これらが違えば、同じ選手の得点は別物になります。 ハーネスは、この「コート+審判+ルール+道具」のセットです。選手を変えずに点数を上げる方法があるのと同じで、モデルを変えずに数字を上げる設計がハーネスにはあります。
スポーツでの例AIエージェントでの対応物
選手の実力モデル(学習済みの重み。こちらでは変えられない)
コートの広さ・ボールサンドボックス・使えるツール
審判とルール解釈採点・評価(どこまでを正解と数えるか)
交代・タイムアウトの回数試行回数・ループの上限
監督の指示と作戦ボードシステムプロンプト・スキル・手順
前の試合の記録を持ち込めるかセッション・記憶の持ち越し(ARC-AGI-3 の 62.7% と 99.9% を分けた点)

この比喩で持ち帰ってほしいのは1点です。「点数が高い/低い」を語るとき、選手の話をしているのか、コートと審判の話をしているのかを分ける。ベンチの数字を読むときの基本は、これに尽きます。

実務では、どう使うか

数字を見たときの3つの確認

  • 誰のハーネスか — ベンダー自身のハーネスか、中立的な第三者(ベンチ運営者)のハーネスか。ARC-AGI-3 は 62.7% と 99.9% で別物でした。
  • そのハーネスは自分の構成に近いか — 推論状態を持ち越せる前提のスコアは、持ち越せない構成では再現しません。逆も同じです。
  • 採点と上限は何か — 試行回数・打ち切り条件・部分点の扱い。ここが違う数字は横に並べても順位になりません。
  • 自社のエージェントを速くしたいとき、まず疑うのはハーネスです。モデルを替えるより、渡すツールを絞る・持ち越す記憶の設計を直す・試行回数を見直すほうが効く場合があります。実際 ARC-AGI-3 の2つのハーネスは、同じモデルで条件を変えただけで別の結果になっています。
  • 再現できない改善は改善ではありません。DeepSeek Harness が「モデルが見たものすべてを追記専用ログに残す」ことを主要機能にしているのは、ハーネス側の変更を検証可能にするためです。自社で組むときも、記録の設計は後回しにしないほうが安全です。
  • 料金表の数字とは別物として扱ってください。ハーネスは性能(スコア・時間・トークン消費)に効く設計の話で、APIの単価そのものを変えるものではありません。料金比較は単価、こちらは「同じ単価で何ができるか」の話です。

まとめ — ひと言でいうと

ハーネス=モデル以外の全部

  • モデルは「頭脳」。ハーネスは、それを働かせるための身体・道具・段取り・審判です。
  • 含まれるもの: システムプロンプト、ツール、スキル、セッション・記憶、サンドボックス、ループ・試行回数、スケジューリング、記録、採点・評価。
  • だから同じモデル・同じベンチでも数字が変わります。ARC-AGI-3 では Standard harness 62.7%(Astra max)/Provider Adapter harness 99.9%(Astra high)と公表されています(ARC Prize)。モデル設定も異なるため、差のすべてがハーネス起因とは言えません。
  • ベンチの数字を読むときは、「どのモデルか」より先に「どのハーネスか」を確認してください。

この言葉が便利なのは、性能の議論を「モデルの良し悪し」から「自分の構成の設計」に引き戻してくれる点です。同じモデルを使っていても、ハーネス次第で結果は変わります。次にベンチの数字を見たら、まずハーネス名を探してみてください。

次に読む

ハーネスの話が出てくる実例は第1回(ベンチ数値の読み方)に、キャッシュ単価の読み方は第2回(プロンプトキャッシュ)にあります。

🧪 用語説明の一覧へ →

用語説明 ・ ベンチ数値の読み方 ・ プロンプトキャッシュ ・ 料金比較 ・ リリース年表

⚠️ 免責事項

  • 引用・数値は2026-09-19に一次情報(DeepSeek 公式ページ、ARC Prize ブログ)で確認したものです。ARC-AGI-3 のスコアとコストは ARC Prize の公表値で、当サイトの測定ではありません。
  • 公式の英文は逐語で引用し、和訳は当サイトによるものです。原文と和訳が食い違う場合は原文を優先してください。
  • DeepSeek Harness は developer preview であり、提供内容・API は今後変わります。導入前に公式ページ・リポジトリをご確認ください。
  • 本サイトは各社と提携しておらず、特定プロバイダーの推薦・代理ではありません。