🧭
ベンチマークとは — 「誰が・何を・どう測るか」で仕分ける
DeepSWE、GDPval-AA、Terminal-bench、OSWorld……多すぎて訳が分からないを解消します。ベンチ名を暗記するのをやめ、①誰が運営しているか ②何を測っているか ③どう測るか(ハーネス・設定)の3つで仕分ける手順を持ち帰る構成。6つのベンチを運営主体の公式リポジトリ・原論文で裏取りし、GDPvalとGDPval-AAがデータセット共通でも別の数字になる理由、ベンチ名と同名のモデル(DeepSWE-Preview)の混同まで扱います。
解説を読む →
📏
1Mコンテキストとは — 100万トークンで何が入るか、いくらになるか
1M=100万トークンは英語で約75万語、音声なら約11時間ぶん。ただし長文の課金ルールは3社で大きく異なります。OpenAIは272K超でリクエスト全体が入力2倍・出力1.5倍、Googleは200K超で全トークンが高い単価、Anthropicは1Mでも標準単価のまま。境界を100トークン超えただけで請求が2倍になる試算(272,000トークン $2.72 → 272,100トークン $5.44)、10往復で入力が245,000トークンに積み上がる例、そして長い入力ほど精度が不安定になる「context rot」(Chroma・2025年7月・18モデル)まで、公式ページで確認した数字だけを掲載します。
解説を読む →
🧰
ハーネス(harness)とは — 同じモデルでもベンチの数字が変わる理由
ハーネスは「モデル以外の全部」。システムプロンプト・ツール・記憶・サンドボックス・試行回数・採点まで含み、同じモデル・同じベンチでもスコアを動かします。ARC-AGI-3で中立ハーネス62.7%/Provider Adapter 99.9%になった条件差(ARC Prize公表)、DeepSeek Harness公式ページの「Agent = Model + Harness」、Minimal modeが公式に「ベンチマーク用の最小環境」と書かれている点まで、出典つきで整理します。
解説を読む →
🗄️
プロンプトキャッシュとは — 「cache hit」の一行を料金で読み解く
同じ入力なのに単価が50倍違う「cache hit」。仕組み(先頭一致)、書込1.25倍・読込0.1倍のルール、TTL(5分〜30分)、キャッシュされる最小トークン数(512〜4,096)を、OpenAI・Anthropic・Google・DeepSeekの公式ドキュメントで比較。8,000トークンの前置きを10回送った場合の試算($0.80→$0.172)付き。
解説を読む →
🧪
GPT-6 Astra「ARC-AGI-3 99.9%・ExploitBench 100%」の読み方
同じベンチでも中立ハーネスでは62.7%(ARC Prize公表)。満点は「もう測れない」の合図。未飽和のTerminal-Bench Science 64.6%がいちばん情報量が多い理由、そして1.05Mコンテキストの272Kトークン境界(超えるとリクエスト全体が入力2倍・出力1.5倍)と128K出力を使い切ったときの$6.40まで。
解説を読む →
🏛️
ベンチマークを運営している組織 — 「誰が測ったか」を見分ける4つの手順
DeepSWEはDatacurve、OSWorldはXLANG Lab、GDPvalはOpenAI、GDPval-AAはArtificial Analysis、AutomationBenchはZapier——ベンチ名から運営組織にたどり着く手順を4ステップに固定しました。①原論文・公式リポジトリ ②組織の分類(ベンダー/独立評価/研究機関/業務ソフト企業) ③スコアの報告者は誰か ④ハーネス提供元。代表12ベンチの運営元一覧と、「第三者が運営=公平ではない」3つの実例(GDPval-AA・AutomationBench・WANDR)付き。
解説を読む →
🔒
ZDR(ゼロデータ保持)とは — 「保存しない」の3つの落とし穴
ZDR は「既定で保存しない」であって「常時有効」ではありません。①保持が必要なモデルの例外リストがあり、②保証には明示指定が要り、③「保存しない」と「担当者が見られない(ZOA)」「学習に使わない」は別の約束です。AWS Bedrock の保持モード(none / default / inherit / aws_review)と設定単位、公開されている例外リスト(OpenAI系モデル・Claude Fable 5 / 5.1)、OpenAI・Anthropic・Google・Microsoft の入手方法(既定か審査制か)を、各社公式ドキュメントの逐語で比較します。用語説明 第7回。
解説を読む →
🛡️
New データを守る4要件とは — 「残さない・見せない・学ばせない・出さない」
「ZDR対応なら安心」は早計です。①残さない(ZDR)②見せない(ZOA)③学ばせない(学習条項)④出さない(データレジデンシー)は別々の約束で、1社が4つ全部を既定で満たすことはまずありません。AWS Bedrock・Microsoft Foundry・OpenAI・Anthropic・Google Cloud の5社について、どこが既定でどこが申請制・審査制かを公式ドキュメントの逐語で並べ、契約前の5ステップとよくある誤解4つまでまとめました。用語説明 第8回。
解説を読む →
🔐
New ZOA(ゼロオペレーターアクセス)とは — 「保存しない」と「見られない」は別の約束
ZDRが「保存の話」なら、ZOAは「人のアクセスの話」。アクセスを止める3つの層(手続き・鍵・実行環境)、鍵管理の3段階(CMK/BYOK/HYOK)、承認フロー(Microsoft Customer Lockbox・Google Access Approval と Key Access Justifications・OpenAI EKM・Anthropicのcontrolled access path)を、AWS Bedrock・Microsoft・Google Cloud・OpenAI・Anthropicの公式ドキュメント逐語で整理しました。緊急時の例外(break glass等)まで明記。用語説明 第9回。
解説を読む →
🚫
New 学習に使わせない(no-training)とは — 「無料で試す」と「契約して使う」で答えが変わる
「ChatGPTは学習に使うのに、APIは使わない」は本当です。学習条項を決めるのは「どの会社か」ではなく「個人向けアプリ・無料枠・API/商用契約のどの層か」。同じGoogleでも、無料枠は「改善に使われ、人間のレビューも入る」、有料枠は「プロンプトも応答も製品改善に使わない」。OpenAI・Anthropic・Google・Microsoft・AWSの公式ドキュメントの逐語で、オプトアウトしても残る2つの例外(フィードバック提供分・安全審査フラグ分)と、無料枠の判定が「料金ではなく請求先アカウント」で決まる仕組みまで整理しました。用語説明 第10回。
解説を読む →
🌍
New 出さない(データレジデンシー)とは — データが国外に出ない=「保存」と「処理」は別の約束
「国外に出さない」は、「保存する場所(at rest)」と「処理する場所(推論)」という2つの別の約束に分かれます。OpenAI は地域ごとに Storage と Processing を別項目で公表し、日本は「保存=可・処理=不可」。AWS は推論プロファイル、Google はエンドポイント、Microsoft は deployment type で3段階、Anthropic は inference geo と workspace geo の2設定——5社すべてで保存と処理は別の確認項目です(設定の仕組みは各社で異なります)。「選べる」と「固定される」の違い、米国限定推論が1.1倍になる価格差、除外サービスまで公式逐語で整理しました。用語説明 第11回。
解説を読む →