Harbor-Index 2026: что такое 82 агентных задачи и потолок 30%
Это не ещё одна сводная таблица. Harbor сначала сводит 80 с лишним агентных наборов в одну трубу, затем оставляет 82 задачи, на которых фронтир всё ещё падает.
3 сентября 2026 на arXiv попал не флагманский файл весов, а общая труба. Harbor Adapters сводит 80 с лишним агентных наборов; Harbor-Index оставляет 82 задачи, на которых фронтир ещё падает.
Искомое событие — Harbor-Index и arXiv:2609.04298. Lin Shi, Haowei Lin и коллеги сообщают о восьми моделях, 54 бенчмарках, Terminus-2 плюс одном из трёх нативных харнессов. Ни одна пара не берёт 30%. GPT-5.5 с Codex ведёт с 28,0%. CCTest повторил абстракт.
Труба и набор задач — разные объекты
Harbor Adapters
Разнородные наборы становятся одним форматом, чтобы любой агент делил вывод и оценку. Эксперименты на паритет — это утверждение, что прогон Harbor всё ещё ведёт себя как исходный экзамен.
Harbor-Index
Восемьдесят две задачи из 29 наборов. Широта остаётся; регулярные прогоны дешевеют. tbench.ai пишет о 226 млрд токенов и более чем 300 тысячах долларов на посев; дистиллированный набор — несколько сотен долларов.
| Ступень воронки | Осталось | Правило |
|---|---|---|
| Пул кандидатов | 6627 | 54 уже подключённых адаптера |
| Фильтр сложности | 1311 | Фронтир-микс ≤33% попыток |
| Автоаудит | 307 | Убрать сломанные пары инструкция/верификатор |
| Люди + починка | 82 | 14 рецензентов; повтор; нечинящееся выбросить |
Что статья реально отдала
- Слой адаптеров
- Больше 80 наборов на Harbor. Паритет должен показать, что общий формат не сплющил исходные задачи.
- Парная оценка
- Восемь моделей, 54 набора; Terminus-2 и один из трёх нативных харнессов. Сбои делятся на модель, харнесс, среду и инструменты.
- Компактный метанабор
- 82 задачи, 29 источников. Фильтр сложности, ИИ- и человеческий аудит, цикл починки. Потолок ниже 30% — замысел, не случайность.
Три способа читать 82
- 01Сначала харнесс, потом модель
Нативные CLI часто чуть выше, без значимости. Слабые модели после смены могут сохранить около 7% решений. Один сводный скриншот роняет рантайм.
- 02Отделять сломанные задачи от трудных
Несовпадение инструкции и верификатора, расплывчатый успех, отсутствующие зависимости — всё это печатает ноль. Воронка нужна, чтобы оставшиеся сбои больше походили на потолок способности.
- 03Читать как набор для повторных прогонов, не как IQ
CCTest замечает: 82 задачи не заменяют все рабочие потоки. Адаптеры, результаты и разбор открыты для проверки и расширения — не чтобы заморозить вечную таблицу.
Сначала общая труба. Оставить задачи, на которых ещё падают. Ранг — побочный эффект.
Линейку нарочно держат низкой
Ни одна проверенная пара не берёт 30%. Это фильтр: системы фронтира должны чаще всего ещё падать, иначе набор насытится.
Если группе нужно выбрать агентный стек на следующую неделю, воронка и доли проходов на одной странице лучше пересланного рейтинга. Микрофон — только когда речь помогает. Короткой комнаты oakmeet достаточно; клиент для eval-созвона не нужен. Пределы — в восемь человек, примерно час.
Harbor-Index — это ещё одна сводная таблица?
Не совсем. Статья отдаёт адаптеры и парную кампанию, затем набор из 82 задач. tbench.ai держит его как дешёвый высокосигнальный комплект, а не замену всех 54 бенчмарков.
Какое число: 28,0% или 28,1%?
Абстракт ставит GPT-5.5 с Codex в 28,0% и пишет, что ни одна пара не выше 30%. Страница tbench.ai пишет 28,1%. Указывать источник. Не сливать в один официальный балл.
Зачем сначала адаптеры?
Агентные наборы требуют тяжёлых сред и не согласны в интерфейсах. Каждый новый агент иначе значит новую интеграцию. Harbor переводит беспорядок в один формат и проверяет перенос паритетом.
Это та же линейка, что Intelligence Index?
Нет. Artificial Analysis публикует взвешенный сводный балл. Harbor-Index — открытый метанабор из 82 агентных задач плюс слой адаптеров. Читать рядом; не переводить одно в другое.