Harbor-Index 是什么:2026智能体评测82题全解析

不是再发一张总分榜。Harbor 先把80多套智能体题接到同一条管道,再留下82道仍然很难的题。

2026年9月3日挂上 arXiv 的不是旗舰权重,是一条共用管道。Harbor Adapters 把80多套智能体基准接到同一处,Harbor-Index 只留下82道仍然很难的题。

可检索的事件是 Harbor-Index 与 arXiv:2609.04298。Lin Shi、Haowei Lin 等人写明:8个模型、54套基准、Terminus-2 加三种原生运行时之一;没有任何模型-运行时组合超过30%,最强是 GPT-5.5 配 Codex 的28.0%。CCTest 转述了同一份摘要。

80+已适配的智能体基准
82Index 里留下的题
28.0%GPT-5.5 + Codex 通过率

管道和题库不是同一件事

Harbor Adapters

把异构基准译成统一格式,任意智能体都能走同一条推理和判分管道。作者用代码审查和对照实验核对:移植后行为应尽量贴近原基准。

Harbor-Index

从适配后的池子里筛出82道题,覆盖29套基准。目标是保留广度,又让日常复跑便宜。tbench.ai 写大规模种子评测花了2260亿 token 和超过30万美元;蒸馏套大约几百美元。

漏斗阶段留下规则
候选池662754 套已接入的适配器
难度过滤1311前线组合试验通过率 ≤33%
自动审计307剔除指令与校验器对不上等坏题
人工 + 修补8214 名审稿人,再跑,修不好的丢掉

论文实际交出的三块

适配层
80余套基准接到 Harbor。对照实验用来证明格式统一之后,原题的语义和难度还在。
对照评测
8个模型、54套基准;每个模型跑 Terminus-2,再跑三种原生运行时之一。失败可以拆成模型、外壳、环境和工具。
精简元数据集
82题、29套来源。难度过滤、自动与人工审计、修补再跑。通过率封顶在30%以下是设计,不是意外。

读这套82题的三条路

  1. 01
    先看外壳再看模型

    官方写原生 CLI 常常略高,但达不到统计显著。弱模型换外壳后能保住的解题可低至约7%。截一张总分当采购结论会漏掉运行时。

  2. 02
    把坏题和难题分开

    指令与校验器打架、成功条件含糊、环境缺依赖,都会产出“零分”。漏斗就是为了让剩下的失败更像能力上限。

  3. 03
    把它当复跑套,不当智商总分

    CCTest 提醒:82题覆盖不了所有真实工作流。适配器、结果和分析已开源,方便核对和增补,而不是钉死一张永久榜。

先共用管道,再留下仍然很难的题。名次是副产品。

尺子刻意留在低位

没有任何被测组合超过30%。这是筛选目标:前线模型大部分时间仍应失败,否则这套题会很快饱和。

若小组要决定下周试哪条智能体栈,把漏斗和通过率摊在同一页,比转发总分截图清楚。需要开口时再开麦。用 oakmeet 开一间会过期的房即可,不必为评测会对齐再装客户端。房间边界见 八人、大约一小时

Harbor-Index 是又一张总分榜吗?

不完全是。论文先交适配层和对照实验,再交82题精简集。tbench.ai 用它当可复跑的高信号套件,而不是替代全部54套基准。

28.0% 和产品页的 28.1% 哪个为准?

论文摘要写 GPT-5.5 配 Codex 为28.0%,并强调没有任何组合超过30%。tbench.ai 产品页写作28.1%。引用时写出来源,不要把两个数字合成一个“官方分”。

为什么先做适配器?

智能体基准环境重、接口不同,每换一个智能体就要重做集成。Harbor 把异构题译成统一格式,并用对照实验核对照搬后是否还像原题。

这和 Intelligence Index 是同一把尺子吗?

不是。Artificial Analysis 的指数是加权综合分;Harbor-Index 是开源的82题智能体元数据集,外加适配层。两套可以并排读,不能直接换算。

即刻开会