Harbor-Indexとは:2026年エージェント評価82問の全解説

総合点の新表ではない。Harborはまず80超のエージェント課題を一本化し、まだ前線が落ちる82問を残す。

2026年9月3日にarXivへ載ったのは旗艦の重みではなく、共用の管だ。Harbor Adaptersは80超のエージェント課題を一本にし、Harbor-Indexはまだ前線が落ちる82問だけを残す。

検索される出来事は Harbor-Index と arXiv:2609.04298 である。Lin Shi、Haowei Linらは8モデル、54本、Terminus-2と3種のネイティブ実行系の一方を報告する。どの組も30%を超えない。GPT-5.5とCodexが28.0%。CCTestは同じ要旨を伝えている。

80+適合したエージェント課題
82Indexに残った問
28.0%GPT-5.5 + Codex 通過率

管と問題集は別物だ

Harbor Adapters

異種の課題を一つの形式にし、任意のエージェントが同じ推論と採点を通る。パリティ実験は、Harbor上の走査が元の試験に近いという主張である。

Harbor-Index

29本から82問。広さは残し、日常の再走を安くする。tbench.aiは種まきに2260億トークンと30万ドル超、蒸留套は数百ドルだと書く。

漏斗残数規則
候補池6627接続済みアダプタ54本
難度フィルタ1311前線の試行通過率 ≤33%
自動監査307指示と検証器の食い違いなどを落とす
人手+修復82査読14人、再走、直せないものは捨てる

論文が渡したもの

アダプタ層
80超の課題をHarborへ。共通形式が元の意味と難度を潰していないことをパリティで示す。
対の評価
8モデル、54本。Terminus-2と3種のネイティブ実行系の一方。失敗はモデル、ハーネス、環境、ツールに分けられる。
薄いメタセット
82問、29源。難度、自動と人手の監査、修復ループ。30%未満の天井は設計である。

82問の読み方

  1. 01
    先に実行系、次にモデル

    ネイティブCLIがわずかに高いことが多いが有意ではない。弱いモデルは入替後に約7%しか残らない。総合1枚ではランタイムが消える。

  2. 02
    壊れた題と難しい題を分ける

    指示と検証器の不一致、曖昧な成功条件、欠けた依存はいずれも零点になる。漏斗は残った失敗を能力の上限に近づける。

  3. 03
    再走キットでありIQ合計ではない

    CCTestは、82問があらゆる実務を代弁できないと書く。アダプタ、結果、分析は公開され、監査と拡張のためであって、永久表を釘付けするためではない。

先に管を共有し、まだ落ちる題を残す。順位は副産物だ。

物差しは意図して低い

どの組も30%を超えない。前線が大半で落ち続けることが条件であり、そうでなければ題はすぐ飽和する。

来週どのエージェント栈を試すかを決めるなら、漏斗と通過率を1ページに広げた方が早い。話す必要が出てからマイクを開く。oakmeetの期限付き部屋で足りる。評価打合せにクライアントは要らない。上限は8人、およそ1時間

Harbor-Indexは別の総合順位表か。

そうではない。論文はアダプタと対照実験を出し、そのあと82問の薄いセットを出す。tbench.aiは安く再走できる高信号キットとして扱い、54本全体の代替にはしない。

28.0%と28.1%、どちらを使うか。

要旨はGPT-5.5とCodexを28.0%とし、どの組も30%超えないと書く。tbench.aiは28.1%。出典を書く。一つの公式点に溶かさない。

なぜ先にアダプタか。

エージェント課題は環境が重く、インターフェースが食い違う。新しいエージェントごとに統合し直すことになる。Harborは雑多な題を一つの形式に訳し、パリティで移植を確認する。

Intelligence Indexと同じ物差しか。

違う。Artificial Analysisは加重総合点である。Harbor-Indexは公開された82問のメタセットとアダプタ層だ。並べて読むことはできる。換算はできない。

今すぐ開始