Главное умение GPT-6 Astra — доводить работу до конца самостоятельно. Она не просто отвечает, а действует: открывает интерфейсы, заполняет формы, правит таблицы, запускает команды. Ниже — по направлениям: что поручать смело, что с проверкой, а что лучше отдать другой модели.

Работать за компьютером вместо вас

OpenAI описывает это так: модель управляет программами так же, как человек — через браузер, электронные таблицы, настольные приложения и терминал. Из показанных примеров: заполнение налоговой декларации, сборка сцены в игровом движке, оформление заказа еды, подбор вакансий.

ТестAstraGPT-5.6 SolЧто мерит
OSWorld 2.072,6%65,7%задачи в настольной среде
ScreenSpot-Pro92,7%76,9%точность попадания по элементам
Mind2Webв 1,9 раза быстреескорость веб-сценариев
Время на задачу OSWorld≈ 40 минут≈ 75 минут

Готовить документы, таблицы и презентации

OpenAI прямо называет создание документов, таблиц и презентаций среди сценариев модели, а также «скучные» операции: заполнение форм, обновление карточек клиентов, ведение календаря. На AutomationBench, где меряют как раз слайды, таблицы и аналитику, у Astra 41,4% против 31,4% у Claude Fable 5.1 и 18,1% у GPT-5.6 Sol — самый большой её отрыв среди «профессиональных» тестов. Правда, 41,4% означает, что почти шесть задач из десяти модель всё же не проходит. На AutomationBench, где меряют как раз слайды, таблицы и аналитику, у Astra 41,4% против 31,4% у Claude Fable 5.1 и 18,1% у GPT-5.6 Sol — самый большой её отрыв среди «профессиональных» тестов. Правда, 41,4% означает, что почти шесть задач из десяти модель всё же не проходит.

  • Отчёт из исходников. Комплект документов на входе — готовый структурированный отчёт на выходе.
  • Таблицы и расчёты. Работа с электронными таблицами напрямую, а не только советы, что в них нажать.
  • Рутина с записями. Обновление данных, перенос между системами, приведение к единому формату.

Важная деталь для документов: на внутреннем тесте галлюцинаций у Astra 4,2% против 12,2% у GPT-5.6 Sol. Втрое меньше выдумок — именно то, что нужно, когда из ответа получается документ. Разбор сценариев — GPT-6 Astra для документов и исследований.

Вести исследования

Здесь работают два свойства сразу: поиск в вебе и очень длинный контекст. На BrowseComp — тесте на поиск информации — у Astra 91,5%. На длинном контексте она удерживает 96,3% точности в диапазоне от 512 тысяч токенов до миллиона.

ТестAstraСравнение
FrontierMath Tier 497,6%87,8% у Claude Fable 5.1
GPQA Diamond96,0%лучший опубликованный результат
Terminal-Bench Science64,6%52,6% у Claude Fable 5.1
GeneBench Pro37,8%28,7% у GPT-5.6 Sol
LifeSciBench60,3%59,9% у GPT-5.6 Sol
Научные и аналитические тесты

Писать и разбирать код

Сильные стороны — инженерная работа вокруг кода, а не только его написание.

ТестAstraЛучший соперник
Terminal-Bench 4.057,755,8 — Claude Fable 5.1
DeepSWE v1.174,1%≈ 74% — Claude Fable 5.1 и Opus 5
SRE-Bench, разбор аварий88,0%55,9% — GPT-5.6 Sol
Внутренний тест на миграцию БД63,9%42,7% — GPT-5.6 Sol
Индекс кодовых агентов67,068,1 — Claude Fable 5

Читать это так: на разборе инцидентов и инфраструктурных задачах Astra далеко впереди, а на написании кода — вровень с флагманами Anthropic, а не выше их.

Кибербезопасность — с оговорками

Формально это самое сильное направление модели: 100% на ExploitBench против 78,5% у GPT-5.6 Sol, обнаружение двух ранее неизвестных уязвимостей в движке V8. Фактически именно поэтому доступ и ограничен: в обычном режиме модель отказывается от продвинутых задач такого рода, а в API проверка прекращает задачу.

Чего она не делает

  • Не пишет лучше Claude. На длинном связном тексте и редактуре флагманы Anthropic по-прежнему сильнее.
  • Не знает свежего. Знания ограничены 30 апреля 2026 года — всё позднее только через поиск.
  • Не показывает рассуждения полностью. OpenAI признаёт снижение наблюдаемости; издание The Information связывает это с техникой, которую называет «recurrent depth», но сама OpenAI такого термина в своих материалах не употребляет.
  • Не принимает аудио и видео. На вход идут только текст и изображения — в отличие, например, от Gemini 3.8 Flash. Картинки и ролики она тоже не создаёт: для этого на платформе есть МедиаЛаб.

Как это применить, пока Astra не открыта

Сценарии, под которые её ждут, на платформе работают уже сейчас — на других моделях каталога: разбор комплектов документов, исследования с поиском, отчёты и презентации, многошаговые задачи в режиме «Задачи» с запуском кода и облачным браузером. Когда мы подключим Astra, эти же сценарии станут автономнее — а привычки и промпты останутся теми же.


Что дальше

👉 Попробовать сценарии на доступных моделях — 100 нейронов при регистрации, карта не нужна.