AA Intelligence Index v4.2 是什麼:私有評測權重翻倍全解析
先換尺子,排名才動。v4.2 把私有評測權重加倍,並換上更難刷分的知識工作題。
2026 年 9 月 4 日,Artificial Analysis 改的不是名單,是尺子。Intelligence Index v4.2 把私有評測的權重翻了一倍。
可檢索的事件是 Intelligence Index v4.2:未公開測試集升到綜合分的 40%,飽和的公開科學題離場,兩套更難刷的知識工作評測進場。OfficeChai 與 AI Weekly 在 9 月 5 日轉述了同一份官方 changelog。
changelog 實際動了什麼
加進去的
AA-Briefcase 測多週代理知識工作,測試集不公開。GDP.pdf 由 Surge AI 出題,100 份 PDF、4592 頁、1275 條原子標準,All-pass 必須全過。
拿掉的
GPQA Diamond 被標為已飽和。官方說它不再能把前線模型拉開。繼續拿它當採購投影片上的第一行,已經說明不了 2026 年秋天的差距。
| 模型 | 實驗室 | v4.2 指數 |
|---|---|---|
| Claude Fable 5.1 | Anthropic | 57 |
| GPT-6 Astra | OpenAI | 55 |
| Claude Opus 5 | Anthropic | 54 |
| Claude Fable 5 / Muse Spark 1.3 | Anthropic / Meta | 53 |
兩道新題在獎什麼
- AA-Briefcase
- 產業專家搭的多週專案,源檔以千計,量表看是否做成,成對比較看分析與呈現。官方寫 Fable 5.1 與 Opus 5 領先,隨後是 Astra 與 Muse Spark 1.3;Astra 相對 GPT-5.6 Sol 大約高 85 個 Elo。
- GDP.pdf
- 單輪專業文件推理,證據散落在正文、表、圖、腳註和排除項裡。Astra 33.2%,Sol 28.2%,Fable 5.1 26.2%。總榜第一和文件切片第一不是同一個名字。
讀新分的三條路
- 01先看權重
40% 落在未公開集上,含 Briefcase、Omniscience 和 CritPt 答案。官方寫明是為了降低實驗室刷公開題的空間,v5 還會再加。
- 02不要跨版本比絕對分
v4.1 的數字和 v4.2 的數字不是同一場考試。OfficeChai 也提醒:Astra 在舊尺上幾乎沒跳,新尺次日就公布了。
- 03切片和總榜分開看
Anthropic 與 OpenAI 領跑總榜;成本柏拉圖上還有 Meta 與 Z.AI。文件題上 OpenAI 更靠前。截一張總榜當採購結論會漏掉切片。
換選區之後再比兩屆選舉,數字還在,含義已經不是同一個。
尺子還在動
9 月 7 日官方又發了 v4.3 預告:升級 Terminal-Bench,並加入帶私有集的 AutomationBench-AA。這是通往 v5 的連續發布,不是一次定終身的榜。
若小組要決定下週試用哪家介面,把 changelog 攤在同一頁上,比轉發一張排行截圖清楚。需要開口時再開麥,用 oakmeet 開一間會過期的房即可,不必先為評測會裝用戶端。房間邊界見 八人、大約一小時。
v4.2 的分數能直接和 v4.1 比嗎?
不能。權重、題庫和一部分評分規則都換了。只能談誰在新尺上靠前,不能說誰比上個月「聰明了 N 分」。
AA-Briefcase 是公開下載的題集嗎?
不是。官方強調它是私有未公開測試集,用來壓低刷題。能核對的是方法說明,不是題目 PDF。
為什麼拿掉 GPQA Diamond?
Artificial Analysis 寫明它已經飽和:前線模型擠在天花板附近,分差不再說明能力差。指數選擇換題,而不是繼續引用一個熟悉卻失效的數字。
v4.3 是另一套指數嗎?
不是。9 月 7 日的說明是同一條發布軌道上的增量:Terminal-Bench 升級,並加入 AutomationBench-AA。讀 v4.2 時把它當成「尺子還沒釘死」的腳註即可。