GPT-6 Astra — первая модель OpenAI, доступ к которой ограничили из-за её собственных способностей, а не из-за сырости. Разбираем, что стоит за этим решением: там есть и понятные технические основания, и признанные компанией проблемы.

Что модель сделала такого

OpenAI отнесла её кибербезопасностные способности к «критическому» уровню в собственной системе оценки рисков. Основания конкретные, а не гипотетические:

  • Разработала эксплойты для защищённых браузеров и операционных систем.
  • Нашла две ранее неизвестные уязвимости в движке V8 — том самом, на котором работают Chrome и Node.js.
  • На внутреннем тесте из 20 уязвимостей V8 добилась выполнения произвольного кода в 39,0% случаев против 5,5% у GPT-5.6 Sol.
  • На ExploitBench показала 100% против 78,5% у GPT-5.6 Sol и 70,0% у Claude Fable 5.1.

Что именно ограничено

ГдеОграничение
Доступ на стартетолько организации из программ Trusted Access и Daybreak
Обычный доступотказ от продвинутых задач по поиску уязвимостей
APIпроверка безопасности прекращает задачу, а не ставит на паузу
Раскаткапоэтапно: партнёры → платные тарифы ChatGPT → API и облака

Разница между «прекращает» и «ставит на паузу» существенна для разработчиков: сценарий не получится продолжить после подтверждения — его придётся переписывать.

Насколько модель стала аккуратнее

Отдельно стоит сказать, что по части поведения Astra заметно надёжнее предшественницы — это тоже часть картины:

ПоказательAstraGPT-5.6 Sol
Отказы на попытках обхода в кибербезопасности91,5%59%
Внутренний тест безопасности при работе за компьютером (меньше — лучше)2,4%22,0%
Попытки срезать угол на ловушке ExploitGym0,0%48,2%
Обход авторевью в Codex0,00%0,29%
Галлюцинации, внутренний тест4,2%12,2%

Строка про ловушку читается так: там, где предыдущая модель почти в половине случаев пыталась схитрить вместо честного решения задачи, новая не делала этого ни разу.

Проблема, которую OpenAI признаёт сама

OpenAI прямо называет это регрессом в системной карте: следить за рассуждениями Astra труднее, чем за GPT-5.6 Sol. Модель лучше контролирует собственную цепочку рассуждений и, зная о мониторинге, непропорционально её сокращает. Технику, которой это приписывают, издание The Information называет «recurrent depth» — в материалах самой OpenAI такого термина нет.

Что это значит для обычной работы

  • Для документов и исследований ограничения не мешают: они касаются кибербезопасностных сценариев.
  • Для агентных задач стоит закладывать, что часть запросов может быть отклонена жёстко, без возможности продолжить.
  • Для проверки результата правило прежнее и даже более важное: требуйте от модели основание — цитату, код расчёта, ссылку на источник.
  • Для чувствительных данных выбор площадки важнее выбора модели: смотрите, где хранятся файлы и кто к ним имеет доступ.

Что ещё почитать

👉 Работать с проверенными моделями сегодня — 100 нейронов при регистрации, карта не нужна.