AA Intelligence Index v4.2とは:非公開テスト比重倍増の全解説
先に物差しが変わった。v4.2は非公開評価の比重を倍にし、最適化しにくい知識業務問題に差し替えた。
2026年9月4日、Artificial Analysisが動かしたのは名簿ではなく物差しだ。Intelligence Index v4.2は非公開評価の比重を倍にした。
検索される出来事は Intelligence Index v4.2 である。ホールドアウトが総合の40%になり、飽和した公開の科学試験が外れ、最適化しにくい知識業務が2本入る。OfficeChaiとAI Weeklyは9月5日、同じ公式changelogを伝えている。
changelogが実際に動かしたもの
入ったもの
AA-Briefcaseは複数週のエージェント知識業務で、セットは非公開。GDP.pdfはSurge AI出題で、PDF100件、4592ページ、原子基準1275。All-passは全通し。
外れたもの
GPQA Diamondは飽和とされた。最前線を分けられない、と公式は書く。調達スライドの1枚目に残しても、2026年秋の差は説明できない。
| モデル | ラボ | v4.2指数 |
|---|---|---|
| Claude Fable 5.1 | Anthropic | 57 |
| GPT-6 Astra | OpenAI | 55 |
| Claude Opus 5 | Anthropic | 54 |
| Claude Fable 5 / Muse Spark 1.3 | Anthropic / Meta | 53 |
新しい課題が報いるもの
- AA-Briefcase
- 産業側が組んだ複数週プロジェクトで、ソースは数千。ルーブリックは完了を、ペア比較は分析と提示を見る。公式はFable 5.1とOpus 5が先頭、次いでAstraとMuse Spark 1.3。AstraはGPT-5.6 Solより約85 Elo高い。
- GDP.pdf
- 1ターンの専門文書推論。根拠は本文、表、図、脚注、除外項に散らばる。Astra 33.2%、Sol 28.2%、Fable 5.1 26.2%。総合首位と文書スライス首位は別の名前だ。
新しい点の読み方
- 01まず比重を見る
40%が非公開に載る。Briefcase、Omniscience、CritPtの解答を含む。狙いは公開セットへの合わせ込みを減らすこと。v5でさらに上がる。
- 02版をまたいで絶対点を比べない
v4.1とv4.2は同じ試験ではない。OfficeChaiも、Astraが旧尺ではほとんど動かず、翌日に新尺が出た、と書いている。
- 03スライスと見出しを分ける
総合はAnthropicとOpenAI。コスト効率のフロンティアにはMetaとZ.AIもいる。文書題はOpenAIが前に出る。総合1枚の截図では足りない。
選挙区を描き直したあとの2回の選挙は、数字があっても意味が同じではない。
物差しはまだ動く
9月7日のv4.3案内は、Terminal-Benchの更新と、非公開セット付きAutomationBench-AAの追加だ。v5への連続リリースであり、永久固定の表ではない。
来週どのAPIを試すかを決めるなら、changelogを1ページに広げた方が、順位画像を転送するより早い。話す必要が出てからマイクを開けばよい。oakmeetの期限付き部屋で足りる。評価打ち合わせにクライアントは要らない。上限は8人、およそ1時間。
v4.2の点をv4.1と直接比べられるか。
できない。比重、課題、採点の一部が変わった。新しい物差しで誰が上かは言える。「先月よりN点賢くなった」は言えない。
AA-Briefcaseは公開ダウンロードか。
違う。公式は非公開ホールドアウトだと書く。刷り込みを抑えるためだ。確認できるのは方法の説明であり、問題PDFではない。
なぜGPQA Diamondを外したのか。
飽和した、とArtificial Analysisは書いた。最前線が天井に集まり、点差が能力差を意味しなくなった。馴染みの数字を引用し続ける代わりに、試験を差し替えた。
v4.3は別の指数か。
違う。9月7日の案内は同じ軌道の増分だ。Terminal-Benchが上がり、AutomationBench-AAが入る。v4.2を読むときの「まだ釘付けではない」という脚注だ。