ハーネス(harness)とは — 「モデルを動かす側」の総体
用語説明 第3回。今回のテーマは ハーネス(harness) です。 第1回で扱った「同じベンチでも Standard harness(中立的な条件)では62.7%」という一行——なぜ同じモデル・同じベンチなのに、数字が変わるのか。 その答えがこの言葉に入っています。用語の定義から始めて、最後には「次にベンチの数字を見たときに何を確認すればいいか」まで持って帰れる形にします。
「Agent = Model + Harness」
結論 — ハーネスは「モデル以外の全部」
なお、ハーネスは料金(APIの単価)そのものを変える話ではありません。単価は各社の料金表で決まり、ハーネスは「同じ単価で何ができるか(スコア・速度・トークン消費)」に効く設計の話です。 エンジニアリングの現場では「モデルを替える」「プロンプトを直す」が話題になりがちですが、実際に数字を動かしているのはその外側の設計であることが多い——だからこの言葉が単独の用語として使われます。 「どのモデルか」だけでなく「どのハーネスか」まで言わないと、性能の話が噛み合わないのです。
まずイメージ — モデルは「頭脳」、ハーネスは「身体・道具・段取り」
DeepSeek の公式ページは、この関係を短い一文で書いています。
※ 公式ページの英文逐語。和訳は当サイトによるものです。
ハーネスに入っているもの(公式の一覧)
「足回り」と言われても幅が広すぎるので、実際に何が入っているかを見ます。DeepSeek Harness の公式ページは、エージェントの能力はすべてプラグインとして実装されると説明し、具体的な項目を挙げています。
| ハーネスの構成要素 | 何を決めているか | 数字が動く理由 |
|---|---|---|
| システムプロンプト | モデルに何を見せ、どんな役割と制約を与えるか | 同じモデルでも、指示が変われば方針が変わる |
| ツール | 使える外部機能(ファイル編集・シェル・検索・API など) | 道具が増えれば解ける問題が増える。減らせば測る条件が変わる |
| スキル・手順 | 作業の型(チェックリスト・定型手順)を先に与えるか | 手順が与えられると、探索のムダが減る |
| セッション・記憶 | 前のやり取りや中間結果をどう持ち越すか | 持ち越せる前提の設計なら、長い課題でも精度が落ちにくい |
| サンドボックス | どの環境で実行するか(隔離・権限・ネットワーク) | 環境が違えば試せる操作そのものが変わる |
| ループ・試行回数 | 何回まで考え直させ・やり直させるか | 回数を増やせば成功率は上がる。上限は結果に直結する |
| スケジューリング | 複数の処理やサブエージェントをどう順序立てるか | 段取り次第で完了までの時間と手数が変わる |
| 記録(ログ) | 入力・推論・ツール呼び出しをどう保存するか | 再現できなければ、改善も検証もできない |
| 採点・評価 | 結果をどう数えるか(正解判定・部分点・打ち切り) | 数え方が変われば、同じ実行でもスコアが変わる |
上段の引用以外の項目は、DeepSeek Harness の公式記載(models / tools / skills / sessions / sandboxes / storage / loops / scheduling / UI)を日本語で整理したものです。「採点・評価」はベンチマークを実施する側の設計要素として当サイトが補足しました(DeepSeek Harness の記載項目ではありません)。
なぜ数字が変わるのか — ARC-AGI-3 の実例(測定条件つき)
抽象論だと腹落ちしないので、実例を1つ見ます。同じモデル(GPT-6 Astra)・同じベンチマーク(ARC-AGI-3)で、ハーネス条件が異なる2つの公表値です。ただしモデル設定も Astra (max) と Astra (high) で異なります。したがって、62.7% と 99.9% の差をハーネスだけの効果と断定することはできません。
| ハーネス(測定条件) | モデル設定 | スコア | コスト | 何をしているか |
|---|---|---|---|---|
| Standard harness (ARC Prize の中立ハーネス=全モデル共通の最小インターフェース) | Astra (max) | 62.7% | $26K | モデルが持ち越すノートを自分で選ぶ。全モデル共通の最小インターフェース |
| Provider Adapter harness (OpenAI 側のハーネス) | Astra (high) | 99.9% | $19K | リクエストをまたいで非公開の推論状態(reasoning state)を保持し、長い会話は圧縮する |
- どちらも「その条件での」最高値です。ARC Prize は両方を SOTA(最先端)と扱っています。片方が誇張で片方が正しい、という話ではありません。
- 同条件で比べられる相手も公表されています。ARC Prize は同じ Standard harness 上での比較として GPT-5.6 Sol 7.8% も示しています(2026-09-15確認)。同じ土俵で見れば約8倍の差で、これも大きな前進です。条件の違う 99.9% と 7.8% を並べると、比較の意味が失われます。
- ベンチ運営者自身が「条件をラベルで明記する」と宣言しています。下記の逐語のとおりです。
出典: ARC Prize「OpenAI's GPT-6 Astra on ARC-AGI-3」(2026-09-19確認)・ARC-AGI Results(個別ページ)。スコアとコストは ARC Prize 公表値で、当サイトによる再計算ではありません。同じハーネスアーキテクチャの背景は第1回の解説も参照してください。
具体的には何のこと? — DeepSeek Harness という実物
「ハーネス」は概念名なので、実物があったほうが分かります。DeepSeek は DeepSeek Harness というエージェント基盤を developer preview(開発者プレビュー)で公開しており、ソースコードも同時に公開されています。公式ページに書かれている範囲で、何を提供するツールなのかを見てみます。
| 公式ページの記載 | 意味 |
|---|---|
| すべてがプラグイン | モデル・ツール・スキル・セッション・サンドボックス・ストレージ・ループ・スケジューリング・UI が、差し替え・組み替えできる部品として提供される |
| Cordis カーネル | プラグインの装着・取り外し・依存関係を管理する中核。エージェントの能力はプラグイン側に住む |
| 設定で組み替え | ソースコードを変えずに、構成ファイルの指定だけで能力を選ぶ・入れ替える・拡張できる |
| 実行の記録 | モデルが見たもの(システムプロンプト・推論・ツール呼び出しと結果・サブエージェントの割り当て・コンテキスト注入)が追記専用のセッションログに全部残る。再開・分岐・検索・再生が同じ記録の上で動く |
実行モードが4つある — ここが「ハーネス差」の実物
公式ページには実行モードが4つ載っています。同じモデルを使っても、渡す道具立てを変えれば測定条件が変わることを、ベンダー自身が機能として用意している形です。
出典: DeepSeek Harness 公式ページ(2026-09-19確認、developer preview)。本文中の英語は公式ページの逐語、日本語は当サイトによる整理です。リポジトリは github.com/deepseek-ai/deepseek-harness。当サイトは DeepSeek と提携しておらず、特定製品の推薦ではありません。
図で整理 — モデルの外側がハーネス
生活に置き換えると — 同じ選手でも、点数は変わる
| スポーツでの例 | AIエージェントでの対応物 |
|---|---|
| 選手の実力 | モデル(学習済みの重み。こちらでは変えられない) |
| コートの広さ・ボール | サンドボックス・使えるツール |
| 審判とルール解釈 | 採点・評価(どこまでを正解と数えるか) |
| 交代・タイムアウトの回数 | 試行回数・ループの上限 |
| 監督の指示と作戦ボード | システムプロンプト・スキル・手順 |
| 前の試合の記録を持ち込めるか | セッション・記憶の持ち越し(ARC-AGI-3 の 62.7% と 99.9% を分けた点) |
この比喩で持ち帰ってほしいのは1点です。「点数が高い/低い」を語るとき、選手の話をしているのか、コートと審判の話をしているのかを分ける。ベンチの数字を読むときの基本は、これに尽きます。
実務では、どう使うか
数字を見たときの3つの確認
- 誰のハーネスか — ベンダー自身のハーネスか、中立的な第三者(ベンチ運営者)のハーネスか。ARC-AGI-3 は 62.7% と 99.9% で別物でした。
- そのハーネスは自分の構成に近いか — 推論状態を持ち越せる前提のスコアは、持ち越せない構成では再現しません。逆も同じです。
- 採点と上限は何か — 試行回数・打ち切り条件・部分点の扱い。ここが違う数字は横に並べても順位になりません。
- 自社のエージェントを速くしたいとき、まず疑うのはハーネスです。モデルを替えるより、渡すツールを絞る・持ち越す記憶の設計を直す・試行回数を見直すほうが効く場合があります。実際 ARC-AGI-3 の2つのハーネスは、同じモデルで条件を変えただけで別の結果になっています。
- 再現できない改善は改善ではありません。DeepSeek Harness が「モデルが見たものすべてを追記専用ログに残す」ことを主要機能にしているのは、ハーネス側の変更を検証可能にするためです。自社で組むときも、記録の設計は後回しにしないほうが安全です。
- 料金表の数字とは別物として扱ってください。ハーネスは性能(スコア・時間・トークン消費)に効く設計の話で、APIの単価そのものを変えるものではありません。料金比較は単価、こちらは「同じ単価で何ができるか」の話です。
まとめ — ひと言でいうと
ハーネス=モデル以外の全部
- モデルは「頭脳」。ハーネスは、それを働かせるための身体・道具・段取り・審判です。
- 含まれるもの: システムプロンプト、ツール、スキル、セッション・記憶、サンドボックス、ループ・試行回数、スケジューリング、記録、採点・評価。
- だから同じモデル・同じベンチでも数字が変わります。ARC-AGI-3 では Standard harness 62.7%(Astra max)/Provider Adapter harness 99.9%(Astra high)と公表されています(ARC Prize)。モデル設定も異なるため、差のすべてがハーネス起因とは言えません。
- ベンチの数字を読むときは、「どのモデルか」より先に「どのハーネスか」を確認してください。
この言葉が便利なのは、性能の議論を「モデルの良し悪し」から「自分の構成の設計」に引き戻してくれる点です。同じモデルを使っていても、ハーネス次第で結果は変わります。次にベンチの数字を見たら、まずハーネス名を探してみてください。
次に読む
ハーネスの話が出てくる実例は第1回(ベンチ数値の読み方)に、キャッシュ単価の読み方は第2回(プロンプトキャッシュ)にあります。
🧪 用語説明の一覧へ →用語説明 ・ ベンチ数値の読み方 ・ プロンプトキャッシュ ・ 料金比較 ・ リリース年表
⚠️ 免責事項
- 引用・数値は2026-09-19に一次情報(DeepSeek 公式ページ、ARC Prize ブログ)で確認したものです。ARC-AGI-3 のスコアとコストは ARC Prize の公表値で、当サイトの測定ではありません。
- 公式の英文は逐語で引用し、和訳は当サイトによるものです。原文と和訳が食い違う場合は原文を優先してください。
- DeepSeek Harness は developer preview であり、提供内容・API は今後変わります。導入前に公式ページ・リポジトリをご確認ください。
- 本サイトは各社と提携しておらず、特定プロバイダーの推薦・代理ではありません。