AA Intelligence Index v4.2 是什么:私有评测权重翻倍全解析

尺子先换了,排名才动。v4.2 把私有评测权重翻倍,并换上更难刷分的知识工作题。

2026 年 9 月 4 日,Artificial Analysis 改的不是名单,是尺子。Intelligence Index v4.2 把私有评测的权重翻了一倍。

可检索的事件是 Intelligence Index v4.2:未公开测试集升到综合分的 40%,饱和的公开科学题离场,两套更难刷的知识工作评测进场。OfficeChai 与 AI Weekly 在 9 月 5 日转述了同一份官方 changelog。

40%私有 / 未公开权重
+2Briefcase 与 GDP.pdf
0GPQA Diamond 留在指数里

changelog 实际动了什么

加进去的

AA-Briefcase 测多周智能体知识工作,测试集不公开。GDP.pdf 由 Surge AI 出题,100 份 PDF、4592 页、1275 条原子标准,All-pass 必须全过。

拿掉的

GPQA Diamond 被标为已饱和。官方说它不再能把前线模型拉开。继续拿它当采购幻灯片上的第一行,已经说明不了 2026 年秋天的差距。

模型实验室v4.2 指数
Claude Fable 5.1Anthropic57
GPT-6 AstraOpenAI55
Claude Opus 5Anthropic54
Claude Fable 5 / Muse Spark 1.3Anthropic / Meta53

两道新题在奖什么

AA-Briefcase
行业专家搭的多周项目,源文件以千计,量表看是否做成,成对比较看分析与呈现。官方写 Fable 5.1 与 Opus 5 领先,随后是 Astra 与 Muse Spark 1.3;Astra 相对 GPT-5.6 Sol 大约高 85 个 Elo。
GDP.pdf
单轮专业文档推理,证据散落在正文、表、图、脚注和排除项里。Astra 33.2%,Sol 28.2%,Fable 5.1 26.2%。总榜第一和文档切片第一不是同一个名字。

读新分的三条路

  1. 01
    先看权重

    40% 落在未公开集上,含 Briefcase、Omniscience 和 CritPt 答案。官方写明是为了降低实验室刷公开题的空间,v5 还会再加。

  2. 02
    不要跨版本比绝对分

    v4.1 的数字和 v4.2 的数字不是同一场考试。OfficeChai 也提醒:Astra 在旧尺上几乎没跳,新尺次日就公布了。

  3. 03
    切片和总榜分开看

    Anthropic 与 OpenAI 领跑总榜;成本帕累托上还有 Meta 与 Z.AI。文档题上 OpenAI 更靠前。截一张总榜当采购结论会漏掉切片。

换选区之后再比两届选举,数字还在,含义已经不是同一个。

尺子还在动

9 月 7 日官方又发了 v4.3 预告:升级 Terminal-Bench,并加入带私有集的 AutomationBench-AA。这是通往 v5 的连续发布,不是一次定终身的榜。

若小组要决定下周试用哪家接口,把 changelog 摊在同一页上,比转发一张排行截图清楚。需要开口时再开麦,用 oakmeet 开一间会过期的房即可,不必先为评测会装客户端。房间边界见 八人、大约一小时

v4.2 的分数能直接和 v4.1 比吗?

不能。权重、题库和一部分评分规则都换了。只能谈谁在新尺上靠前,不能说谁比上个月“聪明了 N 分”。

AA-Briefcase 是公开下载的题集吗?

不是。官方强调它是私有未公开测试集,用来压低刷题。能核对的是方法说明,不是题目 PDF。

为什么拿掉 GPQA Diamond?

Artificial Analysis 写明它已经饱和:前线模型挤在天花板附近,分差不再说明能力差。指数选择换题,而不是继续引用一个熟悉却失效的数字。

v4.3 是另一套指数吗?

不是。9 月 7 日的说明是同一条发布轨道上的增量:Terminal-Bench 升级,并加入 AutomationBench-AA。读 v4.2 时把它当成“尺子还没钉死”的脚注即可。

即刻开会