Harbor-Index 2026: что такое 82 агентных задачи и потолок 30%

Это не ещё одна сводная таблица. Harbor сначала сводит 80 с лишним агентных наборов в одну трубу, затем оставляет 82 задачи, на которых фронтир всё ещё падает.

3 сентября 2026 на arXiv попал не флагманский файл весов, а общая труба. Harbor Adapters сводит 80 с лишним агентных наборов; Harbor-Index оставляет 82 задачи, на которых фронтир ещё падает.

Искомое событие — Harbor-Index и arXiv:2609.04298. Lin Shi, Haowei Lin и коллеги сообщают о восьми моделях, 54 бенчмарках, Terminus-2 плюс одном из трёх нативных харнессов. Ни одна пара не берёт 30%. GPT-5.5 с Codex ведёт с 28,0%. CCTest повторил абстракт.

80+перенесённых агентных наборов
82задач, оставшихся в индексе
28,0%доля GPT-5.5 + Codex

Труба и набор задач — разные объекты

Harbor Adapters

Разнородные наборы становятся одним форматом, чтобы любой агент делил вывод и оценку. Эксперименты на паритет — это утверждение, что прогон Harbor всё ещё ведёт себя как исходный экзамен.

Harbor-Index

Восемьдесят две задачи из 29 наборов. Широта остаётся; регулярные прогоны дешевеют. tbench.ai пишет о 226 млрд токенов и более чем 300 тысячах долларов на посев; дистиллированный набор — несколько сотен долларов.

Ступень воронкиОсталосьПравило
Пул кандидатов662754 уже подключённых адаптера
Фильтр сложности1311Фронтир-микс ≤33% попыток
Автоаудит307Убрать сломанные пары инструкция/верификатор
Люди + починка8214 рецензентов; повтор; нечинящееся выбросить

Что статья реально отдала

Слой адаптеров
Больше 80 наборов на Harbor. Паритет должен показать, что общий формат не сплющил исходные задачи.
Парная оценка
Восемь моделей, 54 набора; Terminus-2 и один из трёх нативных харнессов. Сбои делятся на модель, харнесс, среду и инструменты.
Компактный метанабор
82 задачи, 29 источников. Фильтр сложности, ИИ- и человеческий аудит, цикл починки. Потолок ниже 30% — замысел, не случайность.

Три способа читать 82

  1. 01
    Сначала харнесс, потом модель

    Нативные CLI часто чуть выше, без значимости. Слабые модели после смены могут сохранить около 7% решений. Один сводный скриншот роняет рантайм.

  2. 02
    Отделять сломанные задачи от трудных

    Несовпадение инструкции и верификатора, расплывчатый успех, отсутствующие зависимости — всё это печатает ноль. Воронка нужна, чтобы оставшиеся сбои больше походили на потолок способности.

  3. 03
    Читать как набор для повторных прогонов, не как IQ

    CCTest замечает: 82 задачи не заменяют все рабочие потоки. Адаптеры, результаты и разбор открыты для проверки и расширения — не чтобы заморозить вечную таблицу.

Сначала общая труба. Оставить задачи, на которых ещё падают. Ранг — побочный эффект.

Линейку нарочно держат низкой

Ни одна проверенная пара не берёт 30%. Это фильтр: системы фронтира должны чаще всего ещё падать, иначе набор насытится.

Если группе нужно выбрать агентный стек на следующую неделю, воронка и доли проходов на одной странице лучше пересланного рейтинга. Микрофон — только когда речь помогает. Короткой комнаты oakmeet достаточно; клиент для eval-созвона не нужен. Пределы — в восемь человек, примерно час.

Harbor-Index — это ещё одна сводная таблица?

Не совсем. Статья отдаёт адаптеры и парную кампанию, затем набор из 82 задач. tbench.ai держит его как дешёвый высокосигнальный комплект, а не замену всех 54 бенчмарков.

Какое число: 28,0% или 28,1%?

Абстракт ставит GPT-5.5 с Codex в 28,0% и пишет, что ни одна пара не выше 30%. Страница tbench.ai пишет 28,1%. Указывать источник. Не сливать в один официальный балл.

Зачем сначала адаптеры?

Агентные наборы требуют тяжёлых сред и не согласны в интерфейсах. Каждый новый агент иначе значит новую интеграцию. Harbor переводит беспорядок в один формат и проверяет перенос паритетом.

Это та же линейка, что Intelligence Index?

Нет. Artificial Analysis публикует взвешенный сводный балл. Harbor-Index — открытый метанабор из 82 агентных задач плюс слой адаптеров. Читать рядом; не переводить одно в другое.

Начать