Перейти к содержимому

Обучения

GPT-6 Sol или Claude Opus 5.5: что выбрать — тесты, цена и сценарии

Прямого сравнения GPT-6 Sol и Claude Opus 5.5 нет, но есть два общих теста: в AutomationBench и FrontierCode впереди Opus 5.5, зато её токен вдвое дороже. Разбираем цифры, объясняем, почему OSWorld сравнивать нельзя, и даём промпты для своего теста.

Команда СуперИнтеллекта · · ~9 мин

Прямого сравнения GPT-6 Sol и Claude Opus 5.5 не публиковала ни OpenAI, ни Anthropic, но в анонсах обеих моделей от 22 сентября 2026 года есть два одинаковых теста — и в обоих впереди Opus 5.5: 40,0% против 33,2% в AutomationBench и 54,4% против 49,3% в FrontierCode. Зато токен Opus 5.5 в каталоге СуперИнтеллекта вдвое дороже, чем у Sol. Короткий ответ: Opus 5.5 — когда важен максимум качества на трудной задаче, GPT-6 Sol — когда задач много и важна цена. Обе модели доступны в СуперИнтеллекте с тарифа Про, и их можно сравнить в одном чате.

Есть ли прямое сравнение GPT-6 Sol и Claude Opus 5.5?

Нет. Модели вышли в один день, и каждая компания сравнила свою новинку с прошлыми моделями соперника: OpenAI — с Claude Opus 5 и Fable 5.1, Anthropic — с GPT-6 Astra и GPT-5.6 Sol. Почему так вышло и похоже ли это на тактику, мы разобрали в отдельном материале.

Выручают два теста, которые есть в обоих анонсах: AutomationBench и FrontierCode. Ставить их рядом позволяет то, что опорные значения совпадают: одни и те же модели получили в двух анонсах одинаковые результаты. Значит, тест один и тот же, и числа сопоставимы — с оговоркой, что это всё же данные двух разных компаний из разных анонсов.

МодельAutomationBenchFrontierCode
GPT-6 Astra (max)41,4%53,3%
GPT-5.6 Sol (max)28,8%47,5%
Claude Fable 5.131,4%50,3%
Claude Opus 5 (max)26,9%48,0%
Опорные значения: одинаковые в анонсах OpenAI и Anthropic

Как GPT-6 Sol и Claude Opus 5.5 выступают в общих тестах?

В обоих тестах Opus 5.5 выше: в AutomationBench на 6,8 процентного пункта, в FrontierCode — на 5,1 п. п., если брать лучший результат Sol.

ТестЧто проверяетClaude Opus 5.5 (Anthropic)GPT-6 Sol (OpenAI)
AutomationBenchСквозные бизнес-процессы с 47 инструментами: продажи, маркетинг, операции, поддержка, финансы, HR40,0% (max)33,2% (xhigh), 32,0% (max)
FrontierCode 1.1 MainНе только правильность кода, но и готовность к слиянию: тесты, объём правок, стиль, стандарты кодовой базы54,4%49,3% (max), 48,4% (xhigh)
GPT-6 Sol и Claude Opus 5.5: общие тесты из разных анонсов

Для Sol это не провал. В AutomationBench она на уровне xhigh обходит Claude Opus 5 на max (26,9%) при 9% от стоимости задачи Opus 5 — и даже GPT-6 Astra на уровне low (30,3%), у которой задача в 3,9 раза дороже. Всё это — по данным OpenAI. Но новая модель Claude подняла планку: 40,0% у Opus 5.5 — почти вровень с флагманом OpenAI GPT-6 Astra на максимуме (41,4%).

AutomationBench в анонсе GPT-6: Sol на всех уровнях рядом с GPT-6 Astra, Claude Opus 5 и Fable 5.1, Opus 5.5 здесь нет. По горизонтали — стоимость задачи по данным OpenAI. Источник: openai.com
AutomationBench в анонсе GPT-6: Sol на всех уровнях рядом с GPT-6 Astra, Claude Opus 5 и Fable 5.1, Opus 5.5 здесь нет. По горизонтали — стоимость задачи по данным OpenAI. Источник: openai.com

Отставание Sol в коде видно и на графике самой OpenAI: в FrontierCode даже Claude Opus 5 на medium набирает 53,4% — больше лучшего результата Sol (49,3% на max). Sol заметно сильнее предшественницы GPT-5.6 Sol и догоняет Claude Fable 5.1 на xhigh (48,7%), но до 54,4% у Opus 5.5 не дотягивает.

FrontierCode в анонсе GPT-6: Sol догоняет Claude Fable 5.1, но Claude Opus 5 на medium выше. По горизонтали — стоимость задачи по данным OpenAI. Источник: openai.com
FrontierCode в анонсе GPT-6: Sol догоняет Claude Fable 5.1, но Claude Opus 5 на medium выше. По горизонтали — стоимость задачи по данным OpenAI. Источник: openai.com

Почему результаты OSWorld сравнивать нельзя?

Потому что компании измеряли разные варианты теста. OSWorld 2.0 проверяет работу с компьютером (computer use): модель выполняет задачи в операционной системе, как человек за экраном. Anthropic приводит для Opus 5.5 81,8%, для Opus 5 — 74,0%. OpenAI использует офлайн-набор с частичной оценкой (релиз v2026.08.08): у Sol там 60,5% на xhigh и 64,4% на max, а лучший результат Opus 5 — 70,2% на max. Одна и та же Opus 5 получает 74,0% у Anthropic и не больше 70,2% у OpenAI — опорные значения не сходятся, поэтому 81,8% у Opus 5.5 и результаты Sol ставить рядом нельзя.

С Terminal-Bench 4.0 (работа в командной строке) и GDPval-AA (профессиональные задачи, результат в рейтинге Эло) другая проблема: их приводит только Anthropic, GPT-6 Sol там не измеряли. Известно лишь, что в Terminal-Bench 4.0 Opus 5.5 обходит GPT-6 Astra — 66,4% против 57,9%. Подробнее — в сравнении Opus 5.5 и Astra.

Сколько стоят GPT-6 Sol и Claude Opus 5.5?

В каталоге СуперИнтеллекта токен Claude Opus 5.5 вдвое дороже, чем у GPT-6 Sol. Нейроны списываются по фактическому расходу токенов, поэтому итоговая цена ответа зависит ещё и от того, сколько токенов потратит модель, — а это определяют задача и ступень рассуждений.

Об экономии говорят обе компании, но каждая — относительно своего эталона. По данным OpenAI, задача AutomationBench у Sol на уровне xhigh стоит 9% от задачи Opus 5 на max. По данным Anthropic, Opus 5.5 при настройках по умолчанию примерно на 40% дешевле Opus 5 на типичных задачах и выдаёт ответ более чем на 30% быстрее. Свести эти цифры в одно соотношение нельзя: это разные замеры двух компаний, и ни один не сделан на нашем каталоге. Сколько нейронов уйдёт на вашу задачу, покажет пробный запрос.

Одна оговорка про длинные запросы: по правилам OpenAI запросы длиннее 272 000 токенов у Sol стоят дороже за токен.

Чем GPT-6 Sol и Claude Opus 5.5 отличаются по характеристикам?

Главные различия — в ступенях рассуждений и цене токена: у Sol есть режим без рассуждений, а токен Opus 5.5 вдвое дороже. Контекст и предельная длина ответа почти одинаковые.

ПараметрGPT-6 SolClaude Opus 5.5
Разработчик и выходOpenAI, 22 сентября 2026Anthropic, 22 сентября 2026
Место в линейкеСредняя модель под флагманом GPT-6 Astra, преемница GPT-5.6 SolПервая модель Claude 5.5, преемница Opus 5; по оценке Anthropic, на уровне Fable 5.1 в большинстве задач
Контекст1 050 000 токенов1 000 000 токенов
Максимальный ответДо 128 000 токеновДо 128 000 токенов
Ступени рассужденийШесть: от «Без раздумий» до «Максимум»Пять: от «Быстрее» до «Максимум», режима без рассуждений нет
Цена токена в СуперИнтеллектеКак у GPT-5.6 Sol; вдвое ниже, чем у Opus 5.5Вдвое выше, чем у Sol
Тариф в СуперИнтеллектеС тарифа ПроС тарифа Про
Псевдоним LatestGPT Sol LatestClaude Opus Latest
Сильные стороны по анонсамФактическая точность, агентные сценарии при низкой стоимости задачи, код, работа с компьютеромВыше Sol в обоих общих тестах, работа в командной строке (Terminal-Bench 4.0), ответ более чем на 30% быстрее Opus 5
GPT-6 Sol и Claude Opus 5.5 в СуперИнтеллекте: главное

Какие задачи отдать GPT-6 Sol, а какие Claude Opus 5.5?

Правило простое: Opus 5.5 — туда, где ошибка стоит дороже токенов, Sol — туда, где задач много и расход складывается.

Когда выбирать Claude Opus 5.5

  • Сложная автоматизация. Многошаговые процессы с десятками инструментов — ровно то, что проверяет AutomationBench, где у Opus 5.5 отрыв 6,8 п. п. Ступень — «Ещё глубже» или «Максимум».
  • Код, который пойдёт в основную ветку. FrontierCode оценивает готовность к слиянию, и здесь Opus 5.5 впереди на 5,1 п. п. Сценарии — в гайде по Opus 5.5 для программирования.
  • Работа в командной строке. В Terminal-Bench 4.0 Opus 5.5 обходит даже GPT-6 Astra; Sol там не измеряли.
  • Разовые трудные задачи, где объём небольшой, а цена ошибки высокая: разбор сложного договора, архитектурное решение, стратегия.

Когда выбирать GPT-6 Sol

  • Много однотипных задач и итераций. Агент с десятками вызовов инструментов, серия правок текста, обработка пачки документов: у Opus 5.5 токен вдвое дороже, и на объёме это заметно.
  • Аналитика, где важны факты. Во внутреннем тесте OpenAI на трудных запросах Sol ошибается примерно вдвое реже GPT-5.6 Sol: 6,9% ответов с фактической ошибкой против 15,0% на medium. С Opus 5.5 этот тест не сравнивали.
  • Быстрые ответы. Из этой пары ступень «Без раздумий» есть только у Sol — для простого письма или перевода рассуждения не нужны. Совсем простые вопросы ещё дешевле отдать GPT-6 Luna.

Когда нужны обе

Связка часто лучше выбора одной модели: черновик и итерации — на Sol, финальная проверка — на Opus 5.5. Модель переключается в том же чате, история сохраняется, переписывать промпт не нужно.

Так что выбрать: GPT-6 Sol или Claude Opus 5.5?

Claude Opus 5.5 сильнее в обоих общих тестах, но её токен вдвое дороже, чем у GPT-6 Sol. По заявлению OpenAI, модели GPT-6 лидируют на всей кривой «цена — интеллект», и Sol в этой линейке отвечает за середину: сложная аналитика, код и агенты без цены флагмана. Opus 5.5 — выбор, когда качество на трудной задаче важнее расхода. Разрыв в 5–7 п. п. на вашей задаче может оказаться и больше, и меньше, поэтому последнее слово — за собственной проверкой.

Как сравнить GPT-6 Sol и Claude Opus 5.5 на своей задаче?

Отправьте один и тот же промпт обеим моделям. Это займёт несколько минут и скажет о вашей задаче больше, чем любой бенчмарк.

  1. Откройте новый чат и выберите GPT-6 Sol.
  2. Нажмите чип «Модель · Ступень» рядом с кнопкой модели и в попапе «Усилие» поставьте «Ещё глубже» (xhigh): эта ступень есть у обеих моделей, так сравнение будет честным.
  3. Отправьте промпт ниже, подставив свою задачу.
  4. Переключите модель на Claude Opus 5.5, проверьте, что ступень та же, и отправьте тот же промпт.
  5. Сравните ответы: что точнее, чего не хватает, что лишнее и сколько правок нужно, чтобы результатом можно было пользоваться.

Промпт для сравнения двух моделей на рабочей задаче

Реши задачу с нуля. Не опирайся на ответы других моделей выше в этом чате.

Задача: [опишите реальную задачу из своей работы — например: «Составь план автоматизации обработки заявок с сайта: от формы до счёта клиенту. Инструменты: CRM, почта, таблица учёта»]

Контекст: [кто вы, для кого результат, ограничения по срокам, бюджету и инструментам]

Формат ответа:
1. Решение по шагам — конкретно, без общих слов.
2. Допущения, которые ты сделал, — отдельным списком.
3. Риски и места, где ты не уверен: что стоит проверить человеку.

Не пересказывай условие и не добавляй вступлений.

Промпт для сравнения на задаче по коду

Реши задачу с нуля, не опираясь на предыдущие ответы в этом чате.

Код и описание изменения: [вставьте фрагмент кода или приложите файл и опишите, что нужно изменить]

Требования:
— изменение должно быть готово к слиянию: сохрани стиль и соглашения существующего кода;
— не трогай то, что не относится к задаче;
— добавь или обнови тесты;
— в конце кратко перечисли, что изменено и почему.

Если для решения чего-то не хватает, сначала задай вопросы.

Что выбрать, если GPT-6 Sol и Opus 5.5 — это слишком?

Для повседневных задач хватит GPT-6 Luna: она доступна на бесплатном тарифе и с 23 сентября отвечает по умолчанию всем, кто не выбирал модель сам. Как выбрать между Astra, Sol, Luna и режимом Pro, мы разобрали в отдельном гайде. Всё работает в России без VPN и зарубежной карты, регистрация бесплатная: my.suin.ai/auth/register.


Бесплатная экскурсия · онлайн · до часа

Посмотрите, как это работает на ваших задачах

Эксперт по внедрению покажет платформу вживую: ИИ-агенты, базы знаний, генерация контента и интеграции — на примерах именно ваших процессов. Без обязательств.

  • Разберём 2–3 ваших процесса и покажем, что автоматизируется уже сейчас
  • После встречи — запись, мини-план внедрения и подборка агентов
  • Экскурсию проводит эксперт по внедрению, а не менеджер по продажам

Не готовы к встрече? Пройдите квиз «Готов ли бизнес к ИИ» — получите персональный отчёт и бонусные нейроны за 2 минуты.

Запишитесь на экскурсию

Свяжемся в течение рабочего дня и подберём удобное время.

Защищено reCAPTCHA: Конфиденциальность · Условия