Главная новость GPT-6 Astra — не в том, что она лучше отвечает, а в том, что она перестаёт быть собеседником и становится исполнителем. Модель управляет программами так же, как человек: через браузер, электронные таблицы, настольные приложения и терминал. Разбираем, что это даёт в ведении проектов — и чего это требует взамен.
Насколько лучше она действует
| Тест | Astra | GPT-5.6 Sol | Что мерит |
|---|---|---|---|
| OSWorld 2.0 | 72,6% | 65,7% | задачи в настольной среде |
| ScreenSpot-Pro | 92,7% | 76,9% | точность попадания по элементам |
| Agents' Last Exam | 59,3 | 53,6 | сложные агентные сценарии |
| SRE-Bench | 88,0% | 55,9% | разбор аварий в инфраструктуре |
| Внутренний тест на миграцию БД | 63,9% | 42,7% | перенос данных |
| Время на задачу OSWorld | ≈ 40 минут | ≈ 75 минут | скорость |
Строка про SRE-Bench стоит отдельного внимания: у Claude Fable 5.1 на том же тесте 12,5%. Разбор production-инцидентов — то направление, где Astra не «немного лучше», а в другой категории.
Три механизма, из которых складывается автономность
- Заметки вместо сжатия истории. В Codex вместе с Astra появился экспериментальный механизм: прошлые шаги не схлопываются в пересказ, а остаются доступны для поиска. Агент, который забыл, что путь уже не сработал, ходит по кругу; этот — не ходит. Важная оговорка: это функция оболочки Codex, а не модели в API, и включается она вручную.
- Вопрос без остановки работы. Может уточнить деталь у человека и параллельно продолжать ту часть задачи, которая от ответа не зависит. Прогон не встаёт в ожидании.
- Точность попадания по интерфейсу. 92,7% на ScreenSpot-Pro — это про то, что агент кликает туда, куда собирался. На длинной цепочке действий ошибка в одном клике обесценивает всю цепочку.
Что можно поручать
- Рутину в интерфейсах. Заполнение форм, обновление карточек клиентов, перенос данных между системами, ведение календаря — OpenAI называет именно это первым сценарием.
- Сбор данных из нескольких мест. Пройти по десяти источникам, собрать и свести в таблицу.
- Инженерные операции. Разбор аварии по логам, миграция базы, воспроизведение бага.
- Длинные проектные задачи. Многошаговый сценарий, где следующий шаг зависит от результата предыдущего.
Промпт: агентная задача с контрольными точками
Задача: {что нужно получить}
Исходные данные: {где брать}
Результат: {в каком виде отдать}
Правила работы:
1. Составь план из шагов и покажи его ДО начала работы.
2. Выполняй по шагам. После каждого шага одной строкой пиши, что сделано и что получилось.
3. Если шаг не удался — не обходи молча. Напиши, что именно не вышло, и предложи два варианта.
4. Ничего не удаляй и не отправляй наружу без моего подтверждения.
5. В конце — список всего, что ты изменил, и того, что осталось непроверенным.
Если на каком-то шаге не хватает данных — спроси, но продолжай ту часть работы, которая от ответа не зависит.Что проверять за агентом
- Необратимые действия. Удаление, отправка писем, публикация, платежи — всё это должно быть под подтверждением, а не «на усмотрение».
- Числа. Просите код расчёта; результат «в уме» проверяем только пересчётом.
- Источники. Ссылки и цитаты — по первоисточнику, всегда.
- Границы задачи. Агент, получивший размытую цель, склонен расширять её сам. Формулируйте, чего делать НЕ надо.
Чего ждать не стоит
- Полной прозрачности. Техника «recurrent depth» скрывает часть цепочки рассуждений — понять, почему агент выбрал путь, будет труднее.
- Работы без ограничений. В API проверка безопасности прекращает задачу, а не ставит на паузу: сценарий придётся переписывать, а не продолжать.
- Замены Claude на тексте. Если результат проекта — документ, который пойдёт наружу, финальный текст лучше отдать модели Anthropic: практики отмечают, что Astra хуже перенимает авторский стиль.
- Бесперебойных долгих прогонов. OpenAI впервые включила мониторинг рассогласованности на весь внешний трафик модели и предупреждает, что проверки могут замедлять, приостанавливать или останавливать в том числе законную работу. Чем дольше идёт задача, тем выше шанс, что её прервут.
- Ровной скорости на длинной дистанции. По отзывам первых пользователей, на многочасовых проектах Astra доходит до точки, где прогресс замедляется и модель вязнет в мелких деталях.
Что уже работает на платформе
Агентный сценарий на СуперИнтеллекте существует и сейчас — это режим «Задачи»: модель выполняет многошаговую работу, запускает код в песочнице и ходит в облачном браузере. Отличие от Astra — в длине автономного прогона и в точности действий в интерфейсе, а не в самой возможности.
| Что | Цена |
|---|---|
| Создание песочницы для кода | 18 нейронов |
| Работа кода | 0,1 нейрона за секунду |
| Запуск облачного браузера | 20 нейронов + 0,5 за минуту |
| Токены модели | по цене выбранной модели |
Смысл начать сейчас простой: промпты, базы знаний и привычка формулировать задачу с контрольными точками переносятся один в один. Когда мы подключим Astra, изменится только исполнитель.
Что дальше
👉 Запустить первую агентную задачу — 100 нейронов при регистрации, карта не нужна.



