Harbor-Indexとは:2026年エージェント評価82問の全解説
総合点の新表ではない。Harborはまず80超のエージェント課題を一本化し、まだ前線が落ちる82問を残す。
2026年9月3日にarXivへ載ったのは旗艦の重みではなく、共用の管だ。Harbor Adaptersは80超のエージェント課題を一本にし、Harbor-Indexはまだ前線が落ちる82問だけを残す。
検索される出来事は Harbor-Index と arXiv:2609.04298 である。Lin Shi、Haowei Linらは8モデル、54本、Terminus-2と3種のネイティブ実行系の一方を報告する。どの組も30%を超えない。GPT-5.5とCodexが28.0%。CCTestは同じ要旨を伝えている。
管と問題集は別物だ
Harbor Adapters
異種の課題を一つの形式にし、任意のエージェントが同じ推論と採点を通る。パリティ実験は、Harbor上の走査が元の試験に近いという主張である。
Harbor-Index
29本から82問。広さは残し、日常の再走を安くする。tbench.aiは種まきに2260億トークンと30万ドル超、蒸留套は数百ドルだと書く。
| 漏斗 | 残数 | 規則 |
|---|---|---|
| 候補池 | 6627 | 接続済みアダプタ54本 |
| 難度フィルタ | 1311 | 前線の試行通過率 ≤33% |
| 自動監査 | 307 | 指示と検証器の食い違いなどを落とす |
| 人手+修復 | 82 | 査読14人、再走、直せないものは捨てる |
論文が渡したもの
- アダプタ層
- 80超の課題をHarborへ。共通形式が元の意味と難度を潰していないことをパリティで示す。
- 対の評価
- 8モデル、54本。Terminus-2と3種のネイティブ実行系の一方。失敗はモデル、ハーネス、環境、ツールに分けられる。
- 薄いメタセット
- 82問、29源。難度、自動と人手の監査、修復ループ。30%未満の天井は設計である。
82問の読み方
- 01先に実行系、次にモデル
ネイティブCLIがわずかに高いことが多いが有意ではない。弱いモデルは入替後に約7%しか残らない。総合1枚ではランタイムが消える。
- 02壊れた題と難しい題を分ける
指示と検証器の不一致、曖昧な成功条件、欠けた依存はいずれも零点になる。漏斗は残った失敗を能力の上限に近づける。
- 03再走キットでありIQ合計ではない
CCTestは、82問があらゆる実務を代弁できないと書く。アダプタ、結果、分析は公開され、監査と拡張のためであって、永久表を釘付けするためではない。
先に管を共有し、まだ落ちる題を残す。順位は副産物だ。
物差しは意図して低い
どの組も30%を超えない。前線が大半で落ち続けることが条件であり、そうでなければ題はすぐ飽和する。
来週どのエージェント栈を試すかを決めるなら、漏斗と通過率を1ページに広げた方が早い。話す必要が出てからマイクを開く。oakmeetの期限付き部屋で足りる。評価打合せにクライアントは要らない。上限は8人、およそ1時間。
Harbor-Indexは別の総合順位表か。
そうではない。論文はアダプタと対照実験を出し、そのあと82問の薄いセットを出す。tbench.aiは安く再走できる高信号キットとして扱い、54本全体の代替にはしない。
28.0%と28.1%、どちらを使うか。
要旨はGPT-5.5とCodexを28.0%とし、どの組も30%超えないと書く。tbench.aiは28.1%。出典を書く。一つの公式点に溶かさない。
なぜ先にアダプタか。
エージェント課題は環境が重く、インターフェースが食い違う。新しいエージェントごとに統合し直すことになる。Harborは雑多な題を一つの形式に訳し、パリティで移植を確認する。
Intelligence Indexと同じ物差しか。
違う。Artificial Analysisは加重総合点である。Harbor-Indexは公開された82問のメタセットとアダプタ層だ。並べて読むことはできる。換算はできない。