Harbor-Index 是什麼:2026智能體評測82題全解析
不是再發一張總分榜。Harbor 先把80多套智能體題接到同一條管道,再留下82道仍然很難的題。
2026年9月3日掛上 arXiv 的不是旗艦權重,是一條共用管道。Harbor Adapters 把80多套智能體基準接到同一處,Harbor-Index 只留下82道仍然很難的題。
可檢索的事件是 Harbor-Index 與 arXiv:2609.04298。Lin Shi、Haowei Lin 等人寫明:8個模型、54套基準、Terminus-2 加三種原生執行時之一;沒有任何模型-執行時組合超過30%,最強是 GPT-5.5 配 Codex 的28.0%。CCTest 轉述了同一份摘要。
管道和題庫不是同一件事
Harbor Adapters
把異構基準譯成統一格式,任意智能體都能走同一條推理和判分管道。作者用程式碼審查和對照實驗核對:移植後行為應盡量貼近原基準。
Harbor-Index
從適配後的池子裡篩出82道題,覆蓋29套基準。目標是保留廣度,又讓日常復跑便宜。tbench.ai 寫大規模種子評測花了2260億 token 和超過30萬美元;蒸餾套大約幾百美元。
| 漏斗階段 | 留下 | 規則 |
|---|---|---|
| 候選池 | 6627 | 54 套已接入的適配器 |
| 難度過濾 | 1311 | 前線組合試驗通過率 ≤33% |
| 自動審計 | 307 | 剔除指令與校驗器對不上等壞題 |
| 人工 + 修補 | 82 | 14 名審稿人,再跑,修不好的丟掉 |
論文實際交出的三塊
- 適配層
- 80餘套基準接到 Harbor。對照實驗用來證明格式統一之後,原題的語意和難度還在。
- 對照評測
- 8個模型、54套基準;每個模型跑 Terminus-2,再跑三種原生執行時之一。失敗可以拆成模型、外殼、環境和工具。
- 精簡元資料集
- 82題、29套來源。難度過濾、自動與人工審計、修補再跑。通過率封頂在30%以下是設計,不是意外。
讀這套82題的三條路
- 01先看外殼再看模型
官方寫原生 CLI 常常略高,但達不到統計顯著。弱模型換外殼後能保住的解題可低至約7%。截一張總分當採購結論會漏掉執行時。
- 02把壞題和難題分開
指令與校驗器打架、成功條件含糊、環境缺依賴,都會產出「零分」。漏斗就是為了讓剩下的失敗更像能力上限。
- 03把它當復跑套,不當智商總分
CCTest 提醒:82題覆蓋不了所有真實工作流。適配器、結果和分析已開源,方便核對和增補,而不是釘死一張永久榜。
先共用管道,再留下仍然很難的題。名次是副產品。
尺子刻意留在低位
沒有任何被測組合超過30%。這是篩選目標:前線模型大部分時間仍應失敗,否則這套題會很快飽和。
若小組要決定下週試哪條智能體棧,把漏斗和通過率攤在同一頁,比轉發總分截圖清楚。需要開口時再開麥。用 oakmeet 開一間會過期的房即可,不必為評測會對齊再裝用戶端。房間邊界見 八人、大約一小時。
Harbor-Index 是又一張總分榜嗎?
不完全是。論文先交適配層和對照實驗,再交82題精簡集。tbench.ai 用它當可復跑的高訊號套件,而不是替代全部54套基準。
28.0% 和產品頁的 28.1% 哪個為準?
論文摘要寫 GPT-5.5 配 Codex 為28.0%,並強調沒有任何組合超過30%。tbench.ai 產品頁寫作28.1%。引用時寫出來源,不要把兩個數字合成一個「官方分」。
為什麼先做適配器?
智能體基準環境重、介面不同,每換一個智能體就要重做整合。Harbor 把異構題譯成統一格式,並用對照實驗核對搬移後是否還像原題。
這和 Intelligence Index 是同一把尺子嗎?
不是。Artificial Analysis 的指數是加權綜合分;Harbor-Index 是開源的82題智能體元資料集,外加適配層。兩套可以並排讀,不能直接換算。