Index Artificial Analysis v4.2 : les tests privés passent à 40%

La règle a bougé d’abord. v4.2 double le poids des tests privés et remplace l’examen par un travail plus dur à truquer.

Le 4 septembre 2026, Artificial Analysis n’a pas seulement réordonné des noms. Il a changé la règle. L’Intelligence Index v4.2 double le poids des tests privés.

L’événement que l’on cherche est l’Intelligence Index v4.2 : les jeux tenus à l’écart montent à 40 % du composite, un examen scientifique public saturé sort, deux suites de travail plus dures à truquer entrent. OfficeChai et AI Weekly ont repris le même changelog officiel le 5 septembre.

40%poids privé / hold-out
+2Briefcase et GDP.pdf
0GPQA Diamond resté dans l’index

Ce que le changelog a vraiment déplacé

Ajouté

AA-Briefcase note un travail de connaissance agentique sur plusieurs semaines, jeu privé. GDP.pdf, chez Surge AI, use 100 PDF, 4592 pages et 1275 critères atomiques. All-pass veut dire chaque critère.

Retiré

GPQA Diamond est marqué saturé. La société dit qu’il ne coupe plus la frontier. Le garder en première slide d’un pack fournisseur n’explique plus un écart d’automne 2026.

ModèleLaboIndex v4.2
Claude Fable 5.1Anthropic57
GPT-6 AstraOpenAI55
Claude Opus 5Anthropic54
Claude Fable 5 / Muse Spark 1.3Anthropic / Meta53

Ce que les nouvelles tâches récompensent

AA-Briefcase
Projets de plusieurs semaines bâtis par le métier, des milliers de sources. Les rubriques voient si le travail aboutit ; les paires couvrent analyse et présentation. La société place Fable 5.1 et Opus 5 en tête, puis Astra et Muse Spark 1.3. Astra est environ 85 Elo au-dessus de GPT-5.6 Sol.
GDP.pdf
Raisonnement documentaire en un tour. Les preuves sont dans le texte, les tableaux, les graphiques, les notes et les exclusions. Astra 33,2 %, Sol 28,2 %, Fable 5.1 26,2 %. Le premier du composite n’est pas le premier du document.

Trois lectures du nouveau chiffre

  1. 01
    Lire le poids d’abord

    Quarante pour cent tiennent sur des jeux hold-out, dont Briefcase, Omniscience et les solutions CritPt. Le but déclaré : moins de jeu sur les jeux publics. v5 relèvera encore la part.

  2. 02
    Ne pas comparer les scores absolus entre versions

    Un chiffre v4.1 et un chiffre v4.2 ne sont pas le même examen. OfficeChai a noté qu’Astra bougeait à peine sur l’ancienne règle ; la nouvelle est sortie le lendemain.

  3. 03
    Séparer les tranches du titre

    Anthropic et OpenAI mènent le composite. La frontière coût-par-tâche inclut aussi Meta et Z.AI. Le document favorise OpenAI. Une capture de rang unique laisse tomber les tranches.

Comparer deux élections après un redécoupage : les totaux existent encore. Le sens, non.

La règle bouge encore

Le 7 septembre, une note v4.3 : Terminal-Bench relevé, AutomationBench-AA ajouté avec un jeu privé. C’est un chemin vers v5, pas un tableau gelé.

S’il faut choisir une API à essayer la semaine prochaine, étaler le changelog sur une page vaut mieux qu’un classement transféré. Ouvrir le micro seulement si la voix aide. Une salle oakmeet courte suffit ; pas d’install client pour un point eval. Les limites sont dans huit personnes, environ une heure.

Peut-on comparer un score v4.2 à v4.1 ?

Non. Poids, tâches et une part de la notation ont changé. On peut dire qui est plus haut sur la nouvelle règle. Pas qu’un labo a gagné N points d’intelligence en un mois.

AA-Briefcase se télécharge-t-il ?

Non. La société le décrit comme un jeu privé hold-out, pour réduire le benchmaxxing. On vérifie la méthode, pas le PDF d’items.

Pourquoi retirer GPQA Diamond ?

Artificial Analysis le dit saturé : les modèles frontier se pressent au plafond, les écarts ne veulent plus dire des écarts de capacité. L’index a changé d’examen plutôt que de citer un chiffre familier et usé.

v4.3 est-il un autre index ?

Non. La note du 7 septembre est un incrément sur la même voie : Terminal-Bench monte, AutomationBench-AA entre. Note de bas de page en lisant v4.2 : la règle n’est pas clouée.

Ouvrir