"DeepSWE is a benchmark for measuring frontier coding agents on original, long-horizon software engineering tasks drawn from active open-source repositories. The benchmark includes 113 tasks across TypeScript, Go, Python, JavaScript, and Rust, with isolated environments and program-based verifiers."
— github.com/datacurve-ai/deep-swe(2026-09-23確認)
タスクは書き下ろしで、既存のマージ済みプルリクエストから流用していません。つまりモデルが学習中に答えを見ている可能性を減らしているのが設計の主眼です(汚染対策)。採点は特定の模範解答との一致ではなく、振る舞いを確認する手書きの検証器で行います。Datacurve はこの検証器と人間の採点者の不一致率が 1.4% だったと報告しており、これは隠れたテストスイートとの一致で採点する方式(同社の比較では SWE-bench Pro で 32.4%)より小さい数字です。
混同しやすい別物
「DeepSWE-Preview」はこのベンチマークとは別物です。あちらは Agentica と Together AI が公開した 32B のオープンウェイトモデル(コーディングエージェント用)で、ベンチマークの名前ではありません。「DeepSWE」で検索すると両方が出てくるので、ベンチマークの話かモデルの話かを最初に切り分ける必要があります。
名前が似ているので同じものだと思われがちですが、運営も測り方も別です。データセットだけが共通で、走らせ方が違います。Artificial Analysis の説明(逐語)は "GDPval-AA v2.1 is Artificial Analysis' evaluation framework for OpenAI's GDPval dataset" です。
どう測るか
同社は "Models are given shell access and web browsing capabilities in an agentic loop via Stirrup to solve tasks, with Elo ratings derived from blind pairwise comparisons." と説明しています。つまりシェルとWeb閲覧を渡したエージェントループでタスクを解かせ、ブラインドのペア比較からEloを出します。OpenAI 側が人間の専門家の採点を使うのに対し、こちらはエージェントに道具を渡してEloで並べる——同じタスクでも測っている構図が違います。
運営: Stanford + Laude Institute(コミュニティ型)。主導: Steven Dillmann・Sanmi Koyejo・Ludwig Schmidt ほか
何を測っているか
一般のターミナル操作ではなく、科学研究の実務ワークフローです。生命・物理・地球・数理・工学の5領域にわたります。公式リポジトリは "Terminal-Bench-Science currently contains 70 expert-curated tasks across five broad scientific domains and is growing toward 100+ tasks." と記載しています。
運営: XLANG Lab(香港大学)ほか(Salesforce Research・CMU・University of Waterloo が参加)
何を測っているか
テキストやコードではなく、実際のコンピュータ上のGUI操作です。公式サイトの記載(逐語)は "We also create a benchmark of 369 real-world computer tasks in OSWorld with reliable, reproducible setup and evaluation scripts." です。