Один тест, две цифры: ARC-AGI-3 у GPT-6 Astra — это и 99,9%, и 62,7%. Модель одна и та же. Разница в том, как её запускали. Это не мошенничество и не ошибка — это нормальное свойство бенчмарков, о котором в пересказах новостей обычно молчат. Разбираем все опубликованные числа так, чтобы ими можно было пользоваться при выборе модели.

История про ARC-AGI-3

ARC-AGI-3 — тест на способность выводить закономерность из примеров. Результаты Astra:

Условия замераРезультат
Стандартная обвязка ARC Prize, максимальный режим рассуждений62,7%
Обвязка OpenAI на Responses API, максимальный режим98,6%
Обвязка OpenAI на Responses API, высокий режим — цифра из анонса99,9%

Разрыв — около тридцати шести пунктов, и он целиком объясняется обвязкой. Это не особенность Astra: в собственном исследовании OpenAI смена обвязки поднимала результат GPT-5.6 Sol с 13,3% до 38,3%. Такой тест меряет не модель саму по себе, а собранную вокруг неё систему. При этом даже 62,7% — сильный результат: у Claude Opus 5 на этом тесте 30,2%, у GPT-5.6 Sol — 7,8%.

Где Astra действительно впереди

ТестAstraGPT-5.6 SolЧто мерит
OSWorld 2.072,6%65,7%задачи в настольной среде
OSWorld 2.0, для сравнения Claude Opus 570,2%отрыв всего 2,4 пункта
ScreenSpot-Pro92,7%76,9%попадание по элементам интерфейса
ScreenSpot-Pro, для сравнения Claude Fable 587,3%
Agents' Last Exam59,353,6сложные агентные сценарии
BrowseComp91,5%90,4%поиск информации в вебе
SRE-Bench88,0%55,9%разбор аварий в инфраструктуре
Работа за компьютером и агентные задачи

На SRE-Bench у Claude Fable 5.1 — 12,5%. Это тот случай, когда разрыв не про доли процента, а про разные лиги.

Диапазон контекстаAstraGPT-5.6 Sol
256–512 тысяч токенов100%91,5%
512 тысяч – 1 миллион96,3%73,8%
Длинный контекст, MRCR v2, поиск восьми «иголок»

Вот это — тихая, но, возможно, самая полезная в работе цифра. Заявленный миллион токенов есть у многих моделей; удерживать на нём точность умеют не все.

Академические тесты

ТестAstraClaude Fable 5.1Claude Opus 5
FrontierMath Tier 4 (v2)97,6%87,8%73,2%
GPQA Diamond96,0%
Terminal-Bench Science64,6%52,6%
Humanity's Last Exam с инструментами57,2%65,0%63,6%

Программирование: разрыва почти нет

ТестAstraClaude Fable 5.1Claude Fable 5GPT-5.6 Sol
Terminal-Bench 4.057,755,842,037,3
DeepSWE v1.174,1%≈ 74%72,7%
FrontierCode 1.1 Extended64,5%64,9%
Индекс кодовых агентов Artificial Analysis67,067,268,1

По кодовому индексу это фактически ничья трёх моделей. Отдельная претензия к подаче: на диаграмме OpenAI для DeepSWE взят результат Claude Fable 5.1 в 67,4%, из-за чего отрыв выглядит крупнее реального. Независимые замеры дают Fable 5.1 и Opus 5 около 74% с перекрывающимися погрешностями.

Кибербезопасность: здесь отрыв максимальный

ТестAstraGPT-5.6 SolClaude Fable 5.1
ExploitBench100%78,5%70,0%
ExploitGym42,4%30,3%30,4%
Внутренний порт на 20 уязвимостях V839,0%5,5%

Оговорки существенные: замеры шли без штатных ограничителей, а на ExploitGym сняли обычный шестичасовой лимит времени — для обеих сравниваемых моделей. Именно эти результаты и стали причиной ограничить доступ: модель нашла две ранее неизвестные уязвимости в движке V8.

Сводный индекс: четвёртое место

Artificial Analysis Intelligence Index — независимый агрегат из многих тестов. В версии 4.1.1 расклад такой:

МодельИндекс
Claude Fable 5.165,7
Claude Opus 563,1
Claude Fable 562,1
GPT-6 Astra61,2
GPT-5.6 Sol60,9
Gemini 3.8 Flash58,7

Обратите внимание на предпоследнюю строку: прирост к предыдущему флагману — 0,3 пункта при цене в 2,5 раза выше. Это не придирка недоброжелателей — таблицу с этими числами OpenAI приводит на собственной странице анонса. Вывод отсюда такой: формулу «самая умная модель в мире» сводный индекс не подтверждает. Подтверждает он другое — очень сильный профиль в инженерных задачах и в работе за компьютером.

Что ещё стоит держать в голове

  • Все опубликованные числа сняты на максимальном режиме усилий, если не указано иное. Это поднимает результат и одновременно увеличивает задержку и расход токенов — в обычной работе так никто не считает.
  • Часть тестов внутренние. «Внутренний тест на миграцию базы данных» и подобные проверить со стороны нельзя.
  • Есть регресс по наблюдаемости. OpenAI признаёт: письменные рассуждения Astra отслеживать труднее, чем у GPT-5.6 Sol.
  • Есть регрессия там, куда целится позиционирование. На GDPval-AA v2 — независимом замере по реальным профессиональным задачам — Artificial Analysis фиксирует падение примерно на 80 пунктов Elo относительно GPT-5.6 Sol.
  • Она не первая в агентном кодинге. На DeepSWE v1.1 у Meta Muse Spark 1.3 — 75,4% против 74,1% у Astra.
  • Числа расходятся внутри самих материалов OpenAI. FrontierMath в тексте анонса — «98%», в таблице того же анонса — 97,6%. Terminal-Bench 4.0 в прозе 57,9%, в таблице 57,7%.
  • И расходятся между вендорами. На OSWorld 2.0 OpenAI даёт Astra 72,6% против 70,2% у Claude Opus 5, а Anthropic на том же тесте заявляет 77,9% у Claude Fable 5.1. Замеры сделаны разными сторонами на разных обвязках и публично не сведены — считать вопрос лидерства в работе за компьютером решённым пока нельзя.
  • Есть и обратный результат. На внутреннем тесте галлюцинаций у Astra 4,2% против 12,2% у Sol; независимая Artificial Analysis фиксирует снижение доли галлюцинаций с 92% до 51% — наборы задач разные, но направление одно.

Что дальше

👉 Сравнить модели на своей задаче — 100 нейронов при регистрации, карта не нужна.