Один тест, две цифры: ARC-AGI-3 у GPT-6 Astra — это и 99,9%, и 62,7%. Модель одна и та же. Разница в том, как её запускали. Это не мошенничество и не ошибка — это нормальное свойство бенчмарков, о котором в пересказах новостей обычно молчат. Разбираем все опубликованные числа так, чтобы ими можно было пользоваться при выборе модели.
История про ARC-AGI-3
ARC-AGI-3 — тест на способность выводить закономерность из примеров. Результаты Astra:
| Условия замера | Результат |
|---|---|
| Стандартная обвязка ARC Prize, максимальный режим рассуждений | 62,7% |
| Обвязка OpenAI на Responses API, максимальный режим | 98,6% |
| Обвязка OpenAI на Responses API, высокий режим — цифра из анонса | 99,9% |
Разрыв — около тридцати шести пунктов, и он целиком объясняется обвязкой. Это не особенность Astra: в собственном исследовании OpenAI смена обвязки поднимала результат GPT-5.6 Sol с 13,3% до 38,3%. Такой тест меряет не модель саму по себе, а собранную вокруг неё систему. При этом даже 62,7% — сильный результат: у Claude Opus 5 на этом тесте 30,2%, у GPT-5.6 Sol — 7,8%.
Где Astra действительно впереди
| Тест | Astra | GPT-5.6 Sol | Что мерит |
|---|---|---|---|
| OSWorld 2.0 | 72,6% | 65,7% | задачи в настольной среде |
| OSWorld 2.0, для сравнения Claude Opus 5 | 70,2% | — | отрыв всего 2,4 пункта |
| ScreenSpot-Pro | 92,7% | 76,9% | попадание по элементам интерфейса |
| ScreenSpot-Pro, для сравнения Claude Fable 5 | 87,3% | — | — |
| Agents' Last Exam | 59,3 | 53,6 | сложные агентные сценарии |
| BrowseComp | 91,5% | 90,4% | поиск информации в вебе |
| SRE-Bench | 88,0% | 55,9% | разбор аварий в инфраструктуре |
На SRE-Bench у Claude Fable 5.1 — 12,5%. Это тот случай, когда разрыв не про доли процента, а про разные лиги.
| Диапазон контекста | Astra | GPT-5.6 Sol |
|---|---|---|
| 256–512 тысяч токенов | 100% | 91,5% |
| 512 тысяч – 1 миллион | 96,3% | 73,8% |
Вот это — тихая, но, возможно, самая полезная в работе цифра. Заявленный миллион токенов есть у многих моделей; удерживать на нём точность умеют не все.
Академические тесты
| Тест | Astra | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|
| FrontierMath Tier 4 (v2) | 97,6% | 87,8% | 73,2% |
| GPQA Diamond | 96,0% | — | — |
| Terminal-Bench Science | 64,6% | 52,6% | — |
| Humanity's Last Exam с инструментами | 57,2% | 65,0% | 63,6% |
Программирование: разрыва почти нет
| Тест | Astra | Claude Fable 5.1 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,7 | 55,8 | 42,0 | 37,3 |
| DeepSWE v1.1 | 74,1% | ≈ 74% | — | 72,7% |
| FrontierCode 1.1 Extended | 64,5% | — | 64,9% | — |
| Индекс кодовых агентов Artificial Analysis | 67,0 | 67,2 | 68,1 | — |
По кодовому индексу это фактически ничья трёх моделей. Отдельная претензия к подаче: на диаграмме OpenAI для DeepSWE взят результат Claude Fable 5.1 в 67,4%, из-за чего отрыв выглядит крупнее реального. Независимые замеры дают Fable 5.1 и Opus 5 около 74% с перекрывающимися погрешностями.
Кибербезопасность: здесь отрыв максимальный
| Тест | Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| ExploitBench | 100% | 78,5% | 70,0% |
| ExploitGym | 42,4% | 30,3% | 30,4% |
| Внутренний порт на 20 уязвимостях V8 | 39,0% | 5,5% | — |
Оговорки существенные: замеры шли без штатных ограничителей, а на ExploitGym сняли обычный шестичасовой лимит времени — для обеих сравниваемых моделей. Именно эти результаты и стали причиной ограничить доступ: модель нашла две ранее неизвестные уязвимости в движке V8.
Сводный индекс: четвёртое место
Artificial Analysis Intelligence Index — независимый агрегат из многих тестов. В версии 4.1.1 расклад такой:
| Модель | Индекс |
|---|---|
| Claude Fable 5.1 | 65,7 |
| Claude Opus 5 | 63,1 |
| Claude Fable 5 | 62,1 |
| GPT-6 Astra | 61,2 |
| GPT-5.6 Sol | 60,9 |
| Gemini 3.8 Flash | 58,7 |
Обратите внимание на предпоследнюю строку: прирост к предыдущему флагману — 0,3 пункта при цене в 2,5 раза выше. Это не придирка недоброжелателей — таблицу с этими числами OpenAI приводит на собственной странице анонса. Вывод отсюда такой: формулу «самая умная модель в мире» сводный индекс не подтверждает. Подтверждает он другое — очень сильный профиль в инженерных задачах и в работе за компьютером.
Что ещё стоит держать в голове
- Все опубликованные числа сняты на максимальном режиме усилий, если не указано иное. Это поднимает результат и одновременно увеличивает задержку и расход токенов — в обычной работе так никто не считает.
- Часть тестов внутренние. «Внутренний тест на миграцию базы данных» и подобные проверить со стороны нельзя.
- Есть регресс по наблюдаемости. OpenAI признаёт: письменные рассуждения Astra отслеживать труднее, чем у GPT-5.6 Sol.
- Есть регрессия там, куда целится позиционирование. На GDPval-AA v2 — независимом замере по реальным профессиональным задачам — Artificial Analysis фиксирует падение примерно на 80 пунктов Elo относительно GPT-5.6 Sol.
- Она не первая в агентном кодинге. На DeepSWE v1.1 у Meta Muse Spark 1.3 — 75,4% против 74,1% у Astra.
- Числа расходятся внутри самих материалов OpenAI. FrontierMath в тексте анонса — «98%», в таблице того же анонса — 97,6%. Terminal-Bench 4.0 в прозе 57,9%, в таблице 57,7%.
- И расходятся между вендорами. На OSWorld 2.0 OpenAI даёт Astra 72,6% против 70,2% у Claude Opus 5, а Anthropic на том же тесте заявляет 77,9% у Claude Fable 5.1. Замеры сделаны разными сторонами на разных обвязках и публично не сведены — считать вопрос лидерства в работе за компьютером решённым пока нельзя.
- Есть и обратный результат. На внутреннем тесте галлюцинаций у Astra 4,2% против 12,2% у Sol; независимая Artificial Analysis фиксирует снижение доли галлюцинаций с 92% до 51% — наборы задач разные, но направление одно.
Что дальше
- Что такое GPT-6 Astra
- GPT-6 Astra против Claude Fable 5.1 — одинаковая цена, разные профили
- Сколько стоит GPT-6 Astra
👉 Сравнить модели на своей задаче — 100 нейронов при регистрации, карта не нужна.

