Harbor-Index 是什么:2026智能体评测82题全解析
不是再发一张总分榜。Harbor 先把80多套智能体题接到同一条管道,再留下82道仍然很难的题。
2026年9月3日挂上 arXiv 的不是旗舰权重,是一条共用管道。Harbor Adapters 把80多套智能体基准接到同一处,Harbor-Index 只留下82道仍然很难的题。
可检索的事件是 Harbor-Index 与 arXiv:2609.04298。Lin Shi、Haowei Lin 等人写明:8个模型、54套基准、Terminus-2 加三种原生运行时之一;没有任何模型-运行时组合超过30%,最强是 GPT-5.5 配 Codex 的28.0%。CCTest 转述了同一份摘要。
管道和题库不是同一件事
Harbor Adapters
把异构基准译成统一格式,任意智能体都能走同一条推理和判分管道。作者用代码审查和对照实验核对:移植后行为应尽量贴近原基准。
Harbor-Index
从适配后的池子里筛出82道题,覆盖29套基准。目标是保留广度,又让日常复跑便宜。tbench.ai 写大规模种子评测花了2260亿 token 和超过30万美元;蒸馏套大约几百美元。
| 漏斗阶段 | 留下 | 规则 |
|---|---|---|
| 候选池 | 6627 | 54 套已接入的适配器 |
| 难度过滤 | 1311 | 前线组合试验通过率 ≤33% |
| 自动审计 | 307 | 剔除指令与校验器对不上等坏题 |
| 人工 + 修补 | 82 | 14 名审稿人,再跑,修不好的丢掉 |
论文实际交出的三块
- 适配层
- 80余套基准接到 Harbor。对照实验用来证明格式统一之后,原题的语义和难度还在。
- 对照评测
- 8个模型、54套基准;每个模型跑 Terminus-2,再跑三种原生运行时之一。失败可以拆成模型、外壳、环境和工具。
- 精简元数据集
- 82题、29套来源。难度过滤、自动与人工审计、修补再跑。通过率封顶在30%以下是设计,不是意外。
读这套82题的三条路
- 01先看外壳再看模型
官方写原生 CLI 常常略高,但达不到统计显著。弱模型换外壳后能保住的解题可低至约7%。截一张总分当采购结论会漏掉运行时。
- 02把坏题和难题分开
指令与校验器打架、成功条件含糊、环境缺依赖,都会产出“零分”。漏斗就是为了让剩下的失败更像能力上限。
- 03把它当复跑套,不当智商总分
CCTest 提醒:82题覆盖不了所有真实工作流。适配器、结果和分析已开源,方便核对和增补,而不是钉死一张永久榜。
先共用管道,再留下仍然很难的题。名次是副产品。
尺子刻意留在低位
没有任何被测组合超过30%。这是筛选目标:前线模型大部分时间仍应失败,否则这套题会很快饱和。
若小组要决定下周试哪条智能体栈,把漏斗和通过率摊在同一页,比转发总分截图清楚。需要开口时再开麦。用 oakmeet 开一间会过期的房即可,不必为评测会对齐再装客户端。房间边界见 八人、大约一小时。
Harbor-Index 是又一张总分榜吗?
不完全是。论文先交适配层和对照实验,再交82题精简集。tbench.ai 用它当可复跑的高信号套件,而不是替代全部54套基准。
28.0% 和产品页的 28.1% 哪个为准?
论文摘要写 GPT-5.5 配 Codex 为28.0%,并强调没有任何组合超过30%。tbench.ai 产品页写作28.1%。引用时写出来源,不要把两个数字合成一个“官方分”。
为什么先做适配器?
智能体基准环境重、接口不同,每换一个智能体就要重做集成。Harbor 把异构题译成统一格式,并用对照实验核对照搬后是否还像原题。
这和 Intelligence Index 是同一把尺子吗?
不是。Artificial Analysis 的指数是加权综合分;Harbor-Index 是开源的82题智能体元数据集,外加适配层。两套可以并排读,不能直接换算。