Главная новость GPT-6 Astra — не в том, что она лучше отвечает, а в том, что она перестаёт быть собеседником и становится исполнителем. Модель управляет программами так же, как человек: через браузер, электронные таблицы, настольные приложения и терминал. Разбираем, что это даёт в ведении проектов — и чего это требует взамен.

Насколько лучше она действует

ТестAstraGPT-5.6 SolЧто мерит
OSWorld 2.072,6%65,7%задачи в настольной среде
ScreenSpot-Pro92,7%76,9%точность попадания по элементам
Agents' Last Exam59,353,6сложные агентные сценарии
SRE-Bench88,0%55,9%разбор аварий в инфраструктуре
Внутренний тест на миграцию БД63,9%42,7%перенос данных
Время на задачу OSWorld≈ 40 минут≈ 75 минутскорость

Строка про SRE-Bench стоит отдельного внимания: у Claude Fable 5.1 на том же тесте 12,5%. Разбор production-инцидентов — то направление, где Astra не «немного лучше», а в другой категории.

Три механизма, из которых складывается автономность

  • Заметки вместо сжатия истории. В Codex вместе с Astra появился экспериментальный механизм: прошлые шаги не схлопываются в пересказ, а остаются доступны для поиска. Агент, который забыл, что путь уже не сработал, ходит по кругу; этот — не ходит. Важная оговорка: это функция оболочки Codex, а не модели в API, и включается она вручную.
  • Вопрос без остановки работы. Может уточнить деталь у человека и параллельно продолжать ту часть задачи, которая от ответа не зависит. Прогон не встаёт в ожидании.
  • Точность попадания по интерфейсу. 92,7% на ScreenSpot-Pro — это про то, что агент кликает туда, куда собирался. На длинной цепочке действий ошибка в одном клике обесценивает всю цепочку.

Что можно поручать

  1. Рутину в интерфейсах. Заполнение форм, обновление карточек клиентов, перенос данных между системами, ведение календаря — OpenAI называет именно это первым сценарием.
  2. Сбор данных из нескольких мест. Пройти по десяти источникам, собрать и свести в таблицу.
  3. Инженерные операции. Разбор аварии по логам, миграция базы, воспроизведение бага.
  4. Длинные проектные задачи. Многошаговый сценарий, где следующий шаг зависит от результата предыдущего.

Промпт: агентная задача с контрольными точками

Задача: {что нужно получить}
Исходные данные: {где брать}
Результат: {в каком виде отдать}

Правила работы:
1. Составь план из шагов и покажи его ДО начала работы.
2. Выполняй по шагам. После каждого шага одной строкой пиши, что сделано и что получилось.
3. Если шаг не удался — не обходи молча. Напиши, что именно не вышло, и предложи два варианта.
4. Ничего не удаляй и не отправляй наружу без моего подтверждения.
5. В конце — список всего, что ты изменил, и того, что осталось непроверенным.

Если на каком-то шаге не хватает данных — спроси, но продолжай ту часть работы, которая от ответа не зависит.

Что проверять за агентом

  • Необратимые действия. Удаление, отправка писем, публикация, платежи — всё это должно быть под подтверждением, а не «на усмотрение».
  • Числа. Просите код расчёта; результат «в уме» проверяем только пересчётом.
  • Источники. Ссылки и цитаты — по первоисточнику, всегда.
  • Границы задачи. Агент, получивший размытую цель, склонен расширять её сам. Формулируйте, чего делать НЕ надо.

Чего ждать не стоит

  • Полной прозрачности. Техника «recurrent depth» скрывает часть цепочки рассуждений — понять, почему агент выбрал путь, будет труднее.
  • Работы без ограничений. В API проверка безопасности прекращает задачу, а не ставит на паузу: сценарий придётся переписывать, а не продолжать.
  • Замены Claude на тексте. Если результат проекта — документ, который пойдёт наружу, финальный текст лучше отдать модели Anthropic: практики отмечают, что Astra хуже перенимает авторский стиль.
  • Бесперебойных долгих прогонов. OpenAI впервые включила мониторинг рассогласованности на весь внешний трафик модели и предупреждает, что проверки могут замедлять, приостанавливать или останавливать в том числе законную работу. Чем дольше идёт задача, тем выше шанс, что её прервут.
  • Ровной скорости на длинной дистанции. По отзывам первых пользователей, на многочасовых проектах Astra доходит до точки, где прогресс замедляется и модель вязнет в мелких деталях.

Что уже работает на платформе

Агентный сценарий на СуперИнтеллекте существует и сейчас — это режим «Задачи»: модель выполняет многошаговую работу, запускает код в песочнице и ходит в облачном браузере. Отличие от Astra — в длине автономного прогона и в точности действий в интерфейсе, а не в самой возможности.

ЧтоЦена
Создание песочницы для кода18 нейронов
Работа кода0,1 нейрона за секунду
Запуск облачного браузера20 нейронов + 0,5 за минуту
Токены моделипо цене выбранной модели
Что стоит агентная работа сегодня

Смысл начать сейчас простой: промпты, базы знаний и привычка формулировать задачу с контрольными точками переносятся один в один. Когда мы подключим Astra, изменится только исполнитель.


Что дальше

👉 Запустить первую агентную задачу — 100 нейронов при регистрации, карта не нужна.