Harbor-Index 2026 : 82 tâches agentiques, aucune au-dessus de 30%

Pas un nouveau classement composite. Harbor relie d’abord plus de 80 suites d’agents, puis garde 82 tâches où la frontier échoue encore.

Ce qui est arrivé sur arXiv le 3 septembre 2026 n’était pas un fichier de poids vaisseau-amiral. C’était un tuyau partagé. Harbor Adapters relie plus de 80 suites d’agents ; Harbor-Index garde 82 tâches où la frontier échoue encore.

L’événement que l’on cherche est Harbor-Index et arXiv:2609.04298. Lin Shi, Haowei Lin et collègues rapportent huit modèles, 54 bancs, Terminus-2 plus l’un de trois harness natifs. Aucune paire ne passe 30 %. GPT-5.5 avec Codex mène à 28,0 %. CCTest a repris le résumé.

80+suites agentiques adaptées
82tâches restées dans l’index
28,0%taux GPT-5.5 + Codex

Le tuyau et le jeu d’items ne sont pas le même objet

Harbor Adapters

Des suites hétérogènes deviennent un format, pour qu’un agent quelconque partage inférence et notation. Les expériences de parité affirment qu’un passage Harbor se comporte encore comme l’examen source.

Harbor-Index

Quatre-vingt-deux tâches issues de 29 suites. La largeur reste ; les re-passages courants coûtent moins. tbench.ai indique 226 milliards de jetons et plus de 300 000 dollars pour la graine ; la suite distillée, quelques centaines de dollars.

Étape de l’entonnoirGardéRègle
Vivier662754 adaptateurs déjà branchés
Filtre de difficulté1311Mélange frontier ≤33 % des essais
Audit automatique307Retirer consignes/vérificateurs cassés
Humain + réparation8214 relecteurs ; re-passage ; jeter l’irréparable

Ce que l’article a vraiment livré

Couche d’adaptateurs
Plus de 80 suites sur Harbor. La parité vise à montrer qu’un format commun n’a pas aplati les tâches d’origine.
Évaluation appariée
Huit modèles, 54 suites ; Terminus-2 et l’un de trois harness natifs. Les échecs se partagent entre modèle, harness, environnement et outils.
Méta-jeu compact
82 tâches, 29 sources. Filtre de difficulté, audit IA et humain, boucle de réparation. Un plafond sous 30 % est un choix, pas un accident.

Trois lectures des 82

  1. 01
    Lire le harness avant le modèle

    Les CLI natives sont souvent un peu plus hautes, sans significativité. Les modèles faibles peuvent garder environ 7 % des réussites après un échange. Une capture unique laisse tomber le runtime.

  2. 02
    Séparer tâches cassées et tâches dures

    Consignes et vérificateurs en désaccord, succès vague, dépendances manquantes impriment tous un zéro. L’entonnoir existe pour que les échecs restants ressemblent davantage à un plafond de capacité.

  3. 03
    Le traiter comme un kit de re-passage, pas un QI

    CCTest note que 82 tâches ne tiennent pas lieu de tous les flux. Adaptateurs, résultats et analyse sont ouverts pour auditer et étendre — pas pour geler un tableau éternel.

Partager d’abord le tuyau. Garder les tâches qui échouent encore. Le rang est un effet de bord.

La règle reste basse à dessein

Aucune paire testée ne passe 30 %. C’est le filtre : les systèmes frontier doivent encore échouer le plus souvent, sinon le jeu sature.

S’il faut choisir une pile d’agents la semaine prochaine, l’entonnoir et les taux sur une page valent mieux qu’un classement transféré. Ouvrir le micro seulement si la voix aide. Une salle oakmeet courte suffit ; pas d’install client pour un point eval. Les limites sont dans huit personnes, environ une heure.

Harbor-Index est-il un autre classement composite ?

Pas exactement. L’article livre des adaptateurs et une campagne appariée, puis un kit de 82 tâches. tbench.ai le traite comme une suite bon marché à fort signal, pas comme un remplacement des 54 bancs.

Quel chiffre, 28,0 % ou 28,1 % ?

Le résumé dit 28,0 % pour GPT-5.5 avec Codex, et aucune paire au-dessus de 30 %. La page tbench.ai dit 28,1 %. Citer la source. Ne pas les fondre en un score officiel.

Pourquoi des adaptateurs d’abord ?

Les suites d’agents ont des environnements lourds et des interfaces qui se contredisent. Chaque nouvel agent voudrait sinon une nouvelle intégration. Harbor traduit le désordre en un format et vérifie le portage par parité.

Est-ce la même règle que l’Intelligence Index ?

Non. Artificial Analysis publie un composite pondéré. Harbor-Index est un méta-jeu ouvert de 82 tâches plus une couche d’adaptateurs. Les lire côte à côte ; ne pas convertir l’un en l’autre.

Ouvrir