AA Intelligence Index v4.2란?: 비공개 평가 비중 두 배 해설
자가 먼저 바뀌었다. v4.2는 비공개 평가 비중을 두 배로 올리고 더 맞추기 어려운 지식 업무 문항으로 갈아끼웠다.
2026년 9월 4일 Artificial Analysis가 바꾼 것은 명단이 아니라 자다. Intelligence Index v4.2는 비공개 평가 비중을 두 배로 올렸다.
검색되는 사건은 Intelligence Index v4.2다. 홀드아웃이 종합의 40%가 되고, 포화된 공개 과학 시험이 빠지며, 맞추기 어려운 지식 업무 두 개가 들어온다. OfficeChai와 AI Weekly는 9월 5일 같은 공식 changelog를 전했다.
changelog가 실제로 움직인 것
들어온 것
AA-Briefcase는 여러 주 에이전트 지식 업무이고 세트는 비공개다. GDP.pdf는 Surge AI 출제, PDF 100건, 4592페이지, 원자 기준 1275. All-pass는 전부 통과다.
빠진 것
GPQA Diamond는 포화로 표시됐다. 최전선을 가르지 못한다고 공식은 쓴다. 조달 슬라이드 첫 장에 남겨 둬도 2026년 가을의 차이는 설명되지 않는다.
| 모델 | 랩 | v4.2 지수 |
|---|---|---|
| Claude Fable 5.1 | Anthropic | 57 |
| GPT-6 Astra | OpenAI | 55 |
| Claude Opus 5 | Anthropic | 54 |
| Claude Fable 5 / Muse Spark 1.3 | Anthropic / Meta | 53 |
새 문항이 보상하는 것
- AA-Briefcase
- 업계가 짠 여러 주 프로젝트, 원본은 수천 개. 루브릭은 완료를, 쌍대 비교는 분석과 발표를 본다. 공식은 Fable 5.1과 Opus 5가 앞선다고 쓰고, 이어 Astra와 Muse Spark 1.3. Astra는 GPT-5.6 Sol보다 약 85 Elo 높다.
- GDP.pdf
- 한 턴 전문 문서 추론. 근거는 본문, 표, 그림, 각주, 제외 항목에 흩어진다. Astra 33.2%, Sol 28.2%, Fable 5.1 26.2%. 종합 1위와 문서 슬라이스 1위는 다른 이름이다.
새 점수를 읽는 세 갈래
- 01먼저 비중을 본다
40%가 비공개에 실린다. Briefcase, Omniscience, CritPt 정답을 포함한다. 목적은 공개 세트 맞추기를 줄이는 것이다. v5에서 더 올라간다.
- 02버전 간 절대 점수를 비교하지 않는다
v4.1과 v4.2는 같은 시험이 아니다. OfficeChai도 Astra가 옛 자에서는 거의 움직이지 않았고 다음날 새 자가 나왔다고 적었다.
- 03슬라이스와 헤드라인을 가른다
종합은 Anthropic과 OpenAI. 비용 효율 프론티어에는 Meta와 Z.AI도 있다. 문서 문항은 OpenAI가 앞선다. 종합 한 장의 스크린샷은 슬라이스를 버린다.
선거구를 다시 그린 뒤의 두 선거는 숫자가 남아도 의미가 같지 않다.
자는 아직 움직인다
9월 7일 v4.3 안내는 Terminal-Bench 업그레이드와 비공개 세트가 있는 AutomationBench-AA 추가다. v5로 가는 연속 배포이지, 영원히 고정된 표가 아니다.
다음 주 어떤 API를 시험할지 정해야 한다면 changelog를 한 페이지에 펼치는 편이 순위 이미지를 전달하는 것보다 낫다. 말이 필요할 때 마이크를 열면 된다. 짧은 oakmeet 방으로 충분하고, 평가 회의를 위해 클라이언트를 깔 필요는 없다. 한도는 8명, 대략 한 시간이다.
v4.2 점수를 v4.1과 바로 비교할 수 있나?
없다. 비중, 문항, 채점 일부가 바뀌었다. 새 자에서 누가 위인지는 말할 수 있다. 지난달보다 N점 똑똑해졌다고는 말할 수 없다.
AA-Briefcase는 공개 다운로드인가?
아니다. 공식은 비공개 홀드아웃이라고 한다. 벤치 맞추기를 줄이려는 설계다. 확인할 수 있는 것은 방법 설명이지 문항 PDF가 아니다.
왜 GPQA Diamond를 뺐나?
Artificial Analysis는 포화됐다고 썼다. 최전선이 천장에 몰려 점수 차가 능력 차를 뜻하지 않는다. 익숙하지만 수명을 다한 숫자를 인용하는 대신 시험을 바꿨다.
v4.3은 다른 지수인가?
아니다. 9월 7일 안내는 같은 궤도의 증분이다. Terminal-Bench가 올라가고 AutomationBench-AA가 들어온다. v4.2를 읽을 때 “아직 못 박히지 않았다”는 각주로 보면 된다.