Artificial Analysis Index v4.2: что изменилось в частных тестах
Сначала сдвинулась линейка. v4.2 удваивает вес закрытых тестов и меняет задания на более устойчивые к накрутке.
4 сентября 2026 года Artificial Analysis переставила не имена, а линейку. Intelligence Index v4.2 удваивает вес частных тестов.
Искомое событие — Intelligence Index v4.2: скрытые наборы поднимаются до 40% сводного балла, насыщенный открытый научный экзамен уходит, входят две более устойчивые к накрутке работы со знаниями. OfficeChai и AI Weekly 5 сентября пересказали тот же официальный changelog.
Что changelog сдвинул на деле
Добавили
AA-Briefcase оценивает многонедельную агентную работу на закрытом наборе. GDP.pdf от Surge AI: 100 PDF, 4592 страницы, 1275 атомарных критериев. All-pass — каждый критерий.
Убрали
GPQA Diamond помечен как насыщенный. Фирма пишет, что он больше не режет фронтир. Оставлять его первым слайдом в пакете вендора осенью 2026 уже ничего не объясняет.
| Модель | Лаборатория | Индекс v4.2 |
|---|---|---|
| Claude Fable 5.1 | Anthropic | 57 |
| GPT-6 Astra | OpenAI | 55 |
| Claude Opus 5 | Anthropic | 54 |
| Claude Fable 5 / Muse Spark 1.3 | Anthropic / Meta | 53 |
Что награждают новые задачи
- AA-Briefcase
- Многонедельные проекты отрасли, тысячи исходников. Рубрики смотрят, села ли работа; пары — анализ и подачу. Фирма ставит вперёд Fable 5.1 и Opus 5, затем Astra и Muse Spark 1.3. Astra примерно на 85 Elo выше GPT-5.6 Sol.
- GDP.pdf Одноходовое рассуждение по профессиональным документам. Доказательства в тексте, таблицах, графиках, сносках и исключениях. Astra 33,2%, Sol 28,2%, Fable 5.1 26,2%. Лидер сводного балла и лидер документального среза — разные имена.
Три способа читать новое число
- 01Сначала вес
Сорок процентов лежат на скрытых наборах, включая Briefcase, Omniscience и решения CritPt. Заявленная цель — меньше накрутки открытых сетов. В v5 доля ещё вырастет.
- 02Не сравнивать абсолютные баллы между версиями
Цифра v4.1 и цифра v4.2 — не один экзамен. OfficeChai отметила: Astra на старой линейке почти не сдвинулась; новая вышла на следующий день.
- 03Отделять срезы от заголовка
Anthropic и OpenAI ведут сводку. На фронтире цена/задача также Meta и Z.AI. Документная работа ближе OpenAI. Один скриншот ранга роняет срезы.
Сравнить два выбора после нарезки округов: числа ещё есть. Тот же смысл — нет.
Линейка ещё едет
7 сентября вышла заметка про v4.3: Terminal-Bench поднят, добавлен AutomationBench-AA с закрытым набором. Это путь к v5, а не замороженная таблица.
Если группе нужно выбрать API на следующую неделю, changelog на одной странице лучше пересланного рейтинга. Микрофон — только когда речь помогает. Короткой комнаты oakmeet достаточно; клиент для eval-созвона не нужен. Пределы — в восемь человек, примерно час.
Можно ли сравнивать балл v4.2 с v4.1?
Нет. Веса, задачи и часть разметки изменились. Можно сказать, кто выше на новой линейке. Нельзя сказать, что лаборатория стала умнее на N пунктов за месяц.
AA-Briefcase — это публичная загрузка?
Нет. Фирма описывает его как закрытый hold-out, чтобы снизить benchmaxxing. Проверяется описание метода, не PDF заданий.
Почему убрали GPQA Diamond?
Artificial Analysis пишет, что набор насытился: модели фронтира толпятся у потолка, разрывы больше не значат разрывы способности. Индекс сменил экзамен, а не цитирует знакомое, но израсходованное число.
v4.3 — это другой индекс?
Нет. Заметка от 7 сентября — приращение на той же дорожке: Terminal-Bench растёт, входит AutomationBench-AA. Сноска при чтении v4.2: линейка не прибита.