Harbor-Index 2026 erklärt: 82 Agenten-Aufgaben, keine über 30%
Keine neue Gesamtrangliste. Harbor verbindet zuerst über 80 Agentensuiten, dann bleiben 82 Aufgaben, an denen die Frontier noch scheitert.
Was am 3. September 2026 auf arXiv landete, war keine Flaggschiff-Gewichtsdatei. Es war eine gemeinsame Leitung. Harbor Adapters verbinden über 80 Agentensuiten; Harbor-Index behält 82 Aufgaben, an denen die Frontier noch scheitert.
Das suchbare Ereignis ist der Harbor-Index und arXiv:2609.04298. Lin Shi, Haowei Lin und Kollegen berichten acht Modelle, 54 Benchmarks, Terminus-2 plus eines von drei nativen Harnessen. Kein Paar knackt 30%. GPT-5.5 mit Codex führt mit 28,0%. CCTest hat den Abstract wiederholt.
Leitung und Aufgabensatz sind nicht dasselbe
Harbor Adapters
Heterogene Suiten werden ein Format, damit jeder Agent dieselbe Inferenz und Benotung teilt. Paritätsexperimente sind der Anspruch, dass ein Harbor-Lauf sich wie die Quellprüfung verhält.
Harbor-Index
Zweiundachtzig Aufgaben aus 29 Suiten. Breite bleibt; Routine-Läufe werden billiger. tbench.ai nennt 226 Milliarden Token und mehr als 300.000 Dollar für die Saat; die destillierte Suite kostet ein paar hundert Dollar.
| Trichterstufe | Behalten | Regel |
|---|---|---|
| Kandidatenpool | 6627 | 54 bereits verdrahtete Adapter |
| Schwerefilter | 1311 | Frontier-Mix ≤33% der Versuche |
| Automatisches Audit | 307 | Kaputte Anweisung/Verifier-Paare streichen |
| Mensch + Reparatur | 82 | 14 Gutachter; erneut laufen; Unreparierbares streichen |
Was das Papier wirklich abgeliefert hat
- Adapterschicht
- Mehr als 80 Suiten auf Harbor. Die Parität soll zeigen, dass ein gemeinsames Format die Originalaufgaben nicht plattgedrückt hat.
- Gepaarte Bewertung
- Acht Modelle, 54 Suiten; Terminus-2 und eines von drei nativen Harnessen. Fehler teilen sich in Modell, Harness, Umgebung und Werkzeuge.
- Kompaktes Meta-Set
- 82 Aufgaben, 29 Quellen. Schwerefilter, KI- und Menschenaudit, Reparaturschleife. Eine Decke unter 30% ist Absicht, kein Zufall.
Drei Wege, die 82 zu lesen
- 01Zuerst das Harness, dann das Modell
Native CLIs liegen oft etwas höher, ohne Signifikanz. Schwächere Modelle behalten nach einem Tausch etwa 7% der Lösungen. Ein Gesamtscreenshot lässt die Laufzeit fallen.
- 02Kaputte von schweren Aufgaben trennen
Unpassende Anweisungen und Verifier, vage Erfolgskriterien, fehlende Abhängigkeiten drucken alle eine Null. Der Trichter soll übrig gebliebene Fehler wie eine Fähigkeitsgrenze aussehen lassen.
- 03Als Wiederholungs-Kit lesen, nicht als IQ-Summe
CCTest merkt an, dass 82 Aufgaben nicht jeden Workflow ersetzen. Adapter, Ergebnisse und Analyse sind offen zum Prüfen und Erweitern — nicht zum Einfrieren einer ewigen Tafel.
Zuerst die Leitung teilen. Die Aufgaben behalten, die noch scheitern. Rang ist Nebenwirkung.
Das Maß bleibt absichtlich niedrig
Kein getestetes Paar knackt 30%. Das ist der Filter: Frontier-Systeme sollen meist noch scheitern, sonst sättigt der Satz.
Muss eine Gruppe nächste Woche einen Agentenstack wählen, sind Trichter und Trefferquoten auf einer Seite besser als ein weitergeleitetes Rangbild. Mikrofon erst, wenn Sprechen hilft. Ein kurzer oakmeet-Raum reicht; für eine Eval-Runde braucht niemand einen Client. Grenzen stehen unter acht Personen, etwa eine Stunde.
Ist Harbor-Index eine weitere Gesamtrangliste?
Nicht genau. Das Papier liefert Adapter und eine gepaarte Kampagne, dann ein 82-Aufgaben-Kit. tbench.ai behandelt es als günstige Hochsignal-Suite, nicht als Ersatz für alle 54 Benchmarks.
Welche Zahl, 28,0% oder 28,1%?
Der Abstract nennt GPT-5.5 mit Codex 28,0% und kein Paar über 30%. Die tbench.ai-Seite nennt 28,1%. Die Quelle angeben. Nicht zu einem offiziellen Wert verschmelzen.
Warum zuerst Adapter?
Agentensuiten brauchen schwere Umgebungen und widersprechen sich in Schnittstellen. Jeder neue Agent hieße sonst eine neue Integration. Harbor übersetzt das Durcheinander in ein Format und prüft den Port per Parität.
Ist das dasselbe Maß wie der Intelligence Index?
Nein. Artificial Analysis veröffentlicht ein gewichtetes Komposit. Harbor-Index ist ein offenes 82-Aufgaben-Meta-Set plus Adapterschicht. Nebeneinander lesen; nicht umrechnen.