Harbor-Index 是什麼:2026智能體評測82題全解析

不是再發一張總分榜。Harbor 先把80多套智能體題接到同一條管道,再留下82道仍然很難的題。

2026年9月3日掛上 arXiv 的不是旗艦權重,是一條共用管道。Harbor Adapters 把80多套智能體基準接到同一處,Harbor-Index 只留下82道仍然很難的題。

可檢索的事件是 Harbor-Index 與 arXiv:2609.04298。Lin Shi、Haowei Lin 等人寫明:8個模型、54套基準、Terminus-2 加三種原生執行時之一;沒有任何模型-執行時組合超過30%,最強是 GPT-5.5 配 Codex 的28.0%。CCTest 轉述了同一份摘要。

80+已適配的智能體基準
82Index 裡留下的題
28.0%GPT-5.5 + Codex 通過率

管道和題庫不是同一件事

Harbor Adapters

把異構基準譯成統一格式,任意智能體都能走同一條推理和判分管道。作者用程式碼審查和對照實驗核對:移植後行為應盡量貼近原基準。

Harbor-Index

從適配後的池子裡篩出82道題,覆蓋29套基準。目標是保留廣度,又讓日常復跑便宜。tbench.ai 寫大規模種子評測花了2260億 token 和超過30萬美元;蒸餾套大約幾百美元。

漏斗階段留下規則
候選池662754 套已接入的適配器
難度過濾1311前線組合試驗通過率 ≤33%
自動審計307剔除指令與校驗器對不上等壞題
人工 + 修補8214 名審稿人,再跑,修不好的丟掉

論文實際交出的三塊

適配層
80餘套基準接到 Harbor。對照實驗用來證明格式統一之後,原題的語意和難度還在。
對照評測
8個模型、54套基準;每個模型跑 Terminus-2,再跑三種原生執行時之一。失敗可以拆成模型、外殼、環境和工具。
精簡元資料集
82題、29套來源。難度過濾、自動與人工審計、修補再跑。通過率封頂在30%以下是設計,不是意外。

讀這套82題的三條路

  1. 01
    先看外殼再看模型

    官方寫原生 CLI 常常略高,但達不到統計顯著。弱模型換外殼後能保住的解題可低至約7%。截一張總分當採購結論會漏掉執行時。

  2. 02
    把壞題和難題分開

    指令與校驗器打架、成功條件含糊、環境缺依賴,都會產出「零分」。漏斗就是為了讓剩下的失敗更像能力上限。

  3. 03
    把它當復跑套,不當智商總分

    CCTest 提醒:82題覆蓋不了所有真實工作流。適配器、結果和分析已開源,方便核對和增補,而不是釘死一張永久榜。

先共用管道,再留下仍然很難的題。名次是副產品。

尺子刻意留在低位

沒有任何被測組合超過30%。這是篩選目標:前線模型大部分時間仍應失敗,否則這套題會很快飽和。

若小組要決定下週試哪條智能體棧,把漏斗和通過率攤在同一頁,比轉發總分截圖清楚。需要開口時再開麥。用 oakmeet 開一間會過期的房即可,不必為評測會對齊再裝用戶端。房間邊界見 八人、大約一小時

Harbor-Index 是又一張總分榜嗎?

不完全是。論文先交適配層和對照實驗,再交82題精簡集。tbench.ai 用它當可復跑的高訊號套件,而不是替代全部54套基準。

28.0% 和產品頁的 28.1% 哪個為準?

論文摘要寫 GPT-5.5 配 Codex 為28.0%,並強調沒有任何組合超過30%。tbench.ai 產品頁寫作28.1%。引用時寫出來源,不要把兩個數字合成一個「官方分」。

為什麼先做適配器?

智能體基準環境重、介面不同,每換一個智能體就要重做整合。Harbor 把異構題譯成統一格式,並用對照實驗核對搬移後是否還像原題。

這和 Intelligence Index 是同一把尺子嗎?

不是。Artificial Analysis 的指數是加權綜合分;Harbor-Index 是開源的82題智能體元資料集,外加適配層。兩套可以並排讀,不能直接換算。

立即開會