Artificial Analysis Index v4.2: что изменилось в частных тестах

Сначала сдвинулась линейка. v4.2 удваивает вес закрытых тестов и меняет задания на более устойчивые к накрутке.

4 сентября 2026 года Artificial Analysis переставила не имена, а линейку. Intelligence Index v4.2 удваивает вес частных тестов.

Искомое событие — Intelligence Index v4.2: скрытые наборы поднимаются до 40% сводного балла, насыщенный открытый научный экзамен уходит, входят две более устойчивые к накрутке работы со знаниями. OfficeChai и AI Weekly 5 сентября пересказали тот же официальный changelog.

40%частный / скрытый вес
+2Briefcase и GDP.pdf
0GPQA Diamond в индексе

Что changelog сдвинул на деле

Добавили

AA-Briefcase оценивает многонедельную агентную работу на закрытом наборе. GDP.pdf от Surge AI: 100 PDF, 4592 страницы, 1275 атомарных критериев. All-pass — каждый критерий.

Убрали

GPQA Diamond помечен как насыщенный. Фирма пишет, что он больше не режет фронтир. Оставлять его первым слайдом в пакете вендора осенью 2026 уже ничего не объясняет.

МодельЛабораторияИндекс v4.2
Claude Fable 5.1Anthropic57
GPT-6 AstraOpenAI55
Claude Opus 5Anthropic54
Claude Fable 5 / Muse Spark 1.3Anthropic / Meta53

Что награждают новые задачи

AA-Briefcase
Многонедельные проекты отрасли, тысячи исходников. Рубрики смотрят, села ли работа; пары — анализ и подачу. Фирма ставит вперёд Fable 5.1 и Opus 5, затем Astra и Muse Spark 1.3. Astra примерно на 85 Elo выше GPT-5.6 Sol.
GDP.pdf
Одноходовое рассуждение по профессиональным документам. Доказательства в тексте, таблицах, графиках, сносках и исключениях. Astra 33,2%, Sol 28,2%, Fable 5.1 26,2%. Лидер сводного балла и лидер документального среза — разные имена.

Три способа читать новое число

  1. 01
    Сначала вес

    Сорок процентов лежат на скрытых наборах, включая Briefcase, Omniscience и решения CritPt. Заявленная цель — меньше накрутки открытых сетов. В v5 доля ещё вырастет.

  2. 02
    Не сравнивать абсолютные баллы между версиями

    Цифра v4.1 и цифра v4.2 — не один экзамен. OfficeChai отметила: Astra на старой линейке почти не сдвинулась; новая вышла на следующий день.

  3. 03
    Отделять срезы от заголовка

    Anthropic и OpenAI ведут сводку. На фронтире цена/задача также Meta и Z.AI. Документная работа ближе OpenAI. Один скриншот ранга роняет срезы.

Сравнить два выбора после нарезки округов: числа ещё есть. Тот же смысл — нет.

Линейка ещё едет

7 сентября вышла заметка про v4.3: Terminal-Bench поднят, добавлен AutomationBench-AA с закрытым набором. Это путь к v5, а не замороженная таблица.

Если группе нужно выбрать API на следующую неделю, changelog на одной странице лучше пересланного рейтинга. Микрофон — только когда речь помогает. Короткой комнаты oakmeet достаточно; клиент для eval-созвона не нужен. Пределы — в восемь человек, примерно час.

Можно ли сравнивать балл v4.2 с v4.1?

Нет. Веса, задачи и часть разметки изменились. Можно сказать, кто выше на новой линейке. Нельзя сказать, что лаборатория стала умнее на N пунктов за месяц.

AA-Briefcase — это публичная загрузка?

Нет. Фирма описывает его как закрытый hold-out, чтобы снизить benchmaxxing. Проверяется описание метода, не PDF заданий.

Почему убрали GPQA Diamond?

Artificial Analysis пишет, что набор насытился: модели фронтира толпятся у потолка, разрывы больше не значат разрывы способности. Индекс сменил экзамен, а не цитирует знакомое, но израсходованное число.

v4.3 — это другой индекс?

Нет. Заметка от 7 сентября — приращение на той же дорожке: Terminal-Bench растёт, входит AutomationBench-AA. Сноска при чтении v4.2: линейка не прибита.

Начать