AA Intelligence Index v4.2 是什麼:私有評測權重翻倍全解析

先換尺子,排名才動。v4.2 把私有評測權重加倍,並換上更難刷分的知識工作題。

2026 年 9 月 4 日,Artificial Analysis 改的不是名單,是尺子。Intelligence Index v4.2 把私有評測的權重翻了一倍。

可檢索的事件是 Intelligence Index v4.2:未公開測試集升到綜合分的 40%,飽和的公開科學題離場,兩套更難刷的知識工作評測進場。OfficeChai 與 AI Weekly 在 9 月 5 日轉述了同一份官方 changelog。

40%私有 / 未公開權重
+2Briefcase 與 GDP.pdf
0GPQA Diamond 留在指數裡

changelog 實際動了什麼

加進去的

AA-Briefcase 測多週代理知識工作,測試集不公開。GDP.pdf 由 Surge AI 出題,100 份 PDF、4592 頁、1275 條原子標準,All-pass 必須全過。

拿掉的

GPQA Diamond 被標為已飽和。官方說它不再能把前線模型拉開。繼續拿它當採購投影片上的第一行,已經說明不了 2026 年秋天的差距。

模型實驗室v4.2 指數
Claude Fable 5.1Anthropic57
GPT-6 AstraOpenAI55
Claude Opus 5Anthropic54
Claude Fable 5 / Muse Spark 1.3Anthropic / Meta53

兩道新題在獎什麼

AA-Briefcase
產業專家搭的多週專案,源檔以千計,量表看是否做成,成對比較看分析與呈現。官方寫 Fable 5.1 與 Opus 5 領先,隨後是 Astra 與 Muse Spark 1.3;Astra 相對 GPT-5.6 Sol 大約高 85 個 Elo。
GDP.pdf
單輪專業文件推理,證據散落在正文、表、圖、腳註和排除項裡。Astra 33.2%,Sol 28.2%,Fable 5.1 26.2%。總榜第一和文件切片第一不是同一個名字。

讀新分的三條路

  1. 01
    先看權重

    40% 落在未公開集上,含 Briefcase、Omniscience 和 CritPt 答案。官方寫明是為了降低實驗室刷公開題的空間,v5 還會再加。

  2. 02
    不要跨版本比絕對分

    v4.1 的數字和 v4.2 的數字不是同一場考試。OfficeChai 也提醒:Astra 在舊尺上幾乎沒跳,新尺次日就公布了。

  3. 03
    切片和總榜分開看

    Anthropic 與 OpenAI 領跑總榜;成本柏拉圖上還有 Meta 與 Z.AI。文件題上 OpenAI 更靠前。截一張總榜當採購結論會漏掉切片。

換選區之後再比兩屆選舉,數字還在,含義已經不是同一個。

尺子還在動

9 月 7 日官方又發了 v4.3 預告:升級 Terminal-Bench,並加入帶私有集的 AutomationBench-AA。這是通往 v5 的連續發布,不是一次定終身的榜。

若小組要決定下週試用哪家介面,把 changelog 攤在同一頁上,比轉發一張排行截圖清楚。需要開口時再開麥,用 oakmeet 開一間會過期的房即可,不必先為評測會裝用戶端。房間邊界見 八人、大約一小時

v4.2 的分數能直接和 v4.1 比嗎?

不能。權重、題庫和一部分評分規則都換了。只能談誰在新尺上靠前,不能說誰比上個月「聰明了 N 分」。

AA-Briefcase 是公開下載的題集嗎?

不是。官方強調它是私有未公開測試集,用來壓低刷題。能核對的是方法說明,不是題目 PDF。

為什麼拿掉 GPQA Diamond?

Artificial Analysis 寫明它已經飽和:前線模型擠在天花板附近,分差不再說明能力差。指數選擇換題,而不是繼續引用一個熟悉卻失效的數字。

v4.3 是另一套指數嗎?

不是。9 月 7 日的說明是同一條發布軌道上的增量:Terminal-Bench 升級,並加入 AutomationBench-AA。讀 v4.2 時把它當成「尺子還沒釘死」的腳註即可。

立即開會