Claude Opus 5 или ChatGPT: какая нейросеть лучше
Claude Opus 5 или ChatGPT? Разбираем честно: что стоит за «ChatGPT» (GPT-5.6 Sol и GPT-5.5), где у Opus 5 преимущество, где сильны модели OpenAI, почему прямых бенчмарк-дуэлей почти нет и как проверить обе модели на своей задаче в одном окне чата.
· ~12 мин

Claude Opus 5 или ChatGPT — сравнение, в котором сначала нужно уточнить предмет. ChatGPT — это продукт OpenAI, а внутри него работают конкретные модели: сейчас это GPT-5.6 Sol и GPT-5.5. Claude Opus 5 — флагманская модель Anthropic, вышедшая 23 июля 2026 года: контекст на миллион токенов, «мышление» включено по умолчанию, ставка на глубокие рассуждения, агентное программирование и длинные задачи. Короткий ответ: по сводному рейтингу независимого агрегатора, охватывающего 215 моделей, Claude Opus 5 занимает первое место с 85,88 балла, GPT-5.6 Sol — четвёртое с 81,46. Opus 5 сильнее там, где нужна глубина рассуждений, агентная разработка и работа с длинным контекстом; модели OpenAI остаются универсальным инструментом с уверенными показателями GPT-5.5 в терминальных и профессиональных задачах. Обе линейки доступны в одном окне чата СуперИнтеллекта, так что выбирать вслепую не нужно.
«Claude или ChatGPT» — что именно с чем сравнивать
Запрос звучит как сравнение двух нейросетей, но сравниваются сущности разного уровня. ChatGPT — оболочка: история чатов, приложения, настройки; модели внутри неё меняются несколько раз в год, и «тот же ChatGPT» полгода назад отвечал совсем другой моделью. Claude Opus 5 — конкретная модель с датой выхода и опубликованными характеристиками. Поэтому дальше мы сравниваем Opus 5 именно с моделями OpenAI — GPT-5.6 Sol и GPT-5.5. Так честнее и практичнее: в СуперИнтеллекте вы тоже работаете не с брендом, а выбираете конкретную модель в списке и переключаете её в один клик посреди диалога, не переписывая промпт. Если интересна именно свежая пара флагманов, есть отдельный разбор — Claude Opus 5 против GPT-5.6.
Что такое Claude Opus 5 и в чём его ставка
Opus 5 — модель для задач, которые не решаются с первого взгляда. Режим «мышления» здесь включён по умолчанию, а глубину рассуждений регулируют пять уровней усилий: low, medium, high (по умолчанию), xhigh и max. Контекстное окно — миллион токенов, причём максимум стоит по умолчанию: ничего специально включать не нужно, чтобы загрузить объёмный документ или большой репозиторий. Вывод — до 128 тысяч токенов за ответ, этого хватает на длинный отчёт, техзадание или крупный рефакторинг целиком. Подробный разбор возможностей — в материале что умеет Claude Opus 5.
- Контекст: 1 000 000 токенов, дефолт равен максимуму; вывод — до 128k токенов.
- «Мышление»: включено по умолчанию, пять уровней усилий от low до max.
- Вход: текст, изображения и файлы — можно загрузить скриншот дашборда, скан договора или таблицу.
- Выход: только текст. Изображения, видео и аудио модель не генерирует — для этого в СуперИнтеллекте есть раздел МедиаЛаб.
- Сильные стороны: глубокие рассуждения, агентное программирование и длинные задачи, ревью кода и поиск багов, длинный контекст, офисные сценарии (таблицы, презентации), мультиагентные схемы вида writer-verifier, «зрение» по графикам, документам и вёрстке.
- Бенчмарки по данным Anthropic и независимых замеров: SWE-bench Verified 96,0%; SWE-bench Pro 79,2%; SWE-bench Multilingual 89,5%; BrowseComp 90,8%; Toolathlon 80,6%; GPQA Diamond 93,2%; HLE (с инструментами) 64,7%; ARC-AGI-2 90,4%; ARC-AGI-1 97,5%; MMMU-Pro 84,7%; IMO 2026 — 42 из 42.
Что стоит за «ChatGPT»: GPT-5.6 Sol и GPT-5.5
У OpenAI сейчас два актуальных для сравнения представителя. GPT-5.6 Sol — более свежая модель, по которой у нас есть проверяемая величина только одна: четвёртое место с 81,46 балла в сводном рейтинге независимого агрегатора из 215 моделей. Никаких других чисел по ней мы сознательно не приводим — выдумывать бенчмарки ради красивой таблицы неправильно. По GPT-5.5, вышедшей в апреле 2026 года, данных заметно больше: это универсальная рабочая модель с миллионным контекстом и большим скачком в удержании информации по сравнению с предыдущим поколением.
- GPT-5.5 (OpenAI, апрель 2026): контекст 1 млн токенов (400k в среде Codex), вход — текст, изображения и файлы.
- Terminal-Bench 2.0 — 82,7%: работа в терминале и инженерная автоматизация.
- Expert-SWE — 73,1%: экспертные задачи по разработке.
- GDPval — 84,9%: профессиональные задачи широкого профиля.
- Удержание контекста — 74% против 36,6% у GPT-5.4: рост более чем вдвое, что критично для длинных диалогов и больших документов.
- GPT-5.6 Sol (OpenAI): четвёртое место в сводном рейтинге независимого агрегатора с 81,46 балла из 215 моделей.
Claude Opus 5 против моделей OpenAI: характеристики и бенчмарки
| Параметр | Claude Opus 5 | GPT-5.5 |
|---|---|---|
| Разработчик | Anthropic | OpenAI |
| Дата выхода | 23 июля 2026 | апрель 2026 |
| Контекстное окно | 1 000 000 токенов, максимум стоит по умолчанию | 1 000 000 токенов (400k в среде Codex) |
| Максимальный вывод | до 128 000 токенов за ответ | подтверждённого значения у нас нет |
| Вход | текст, изображения, файлы | текст, изображения, файлы |
| Выход | только текст: изображения, видео и аудио не генерирует | подтверждённого значения у нас нет |
| Режим «мышления» | включён по умолчанию, пять уровней усилий: low → max | подтверждённых данных у нас нет |
| Ключевая ставка | глубина рассуждений, агентный код, длинные задачи, длинный контекст | терминальные, инженерные и профессиональные задачи, удержание контекста |
| Тест | Claude Opus 5 | GPT-5.5 | Чей замер |
|---|---|---|---|
| SWE-bench Verified | 96,0% | одноимённого замера нет | Anthropic и независимые замеры |
| SWE-bench Pro | 79,2% | одноимённого замера нет | Anthropic и независимые замеры |
| SWE-bench Multilingual | 89,5% | одноимённого замера нет | Anthropic и независимые замеры |
| GPQA Diamond | 93,2% | одноимённого замера нет | Anthropic и независимые замеры |
| ARC-AGI-2 / ARC-AGI-1 | 90,4% / 97,5% | одноимённого замера нет | Anthropic и независимые замеры |
| BrowseComp | 90,8% | одноимённого замера нет | Anthropic и независимые замеры |
| Toolathlon | 80,6% | одноимённого замера нет | Anthropic и независимые замеры |
| MMMU-Pro | 84,7% | одноимённого замера нет | Anthropic и независимые замеры |
| HLE (с инструментами) | 64,7% | одноимённого замера нет | Anthropic и независимые замеры |
| Terminal-Bench 2.0 | одноимённого замера нет | 82,7% | публикации по GPT-5.5 |
| Expert-SWE | одноимённого замера нет | 73,1% | публикации по GPT-5.5 |
| GDPval | одноимённого замера нет | 84,9% | публикации по GPT-5.5 |
| Удержание контекста | одноимённого замера нет | 74% (у GPT-5.4 — 36,6%) | публикации по GPT-5.5 |
Отсюда главный практический вывод: любой материал, где «96,0% против 82,7%» подаётся как разгром, вводит читателя в заблуждение. Это разные экзамены с разными правилами. SWE-bench Verified проверяет способность закрывать реальные issue в репозиториях, Terminal-Bench — работу в командной строке, GDPval — профессиональные задачи широкого профиля. Каждая цифра осмысленна внутри своего теста и бессмысленна при переносе на чужой. Единственное место, где обе линейки измерены одной методикой, — сводный рейтинг независимого агрегатора.
Сводный рейтинг агрегатора: единственное прямое сравнение
| Место | Модель | Балл |
|---|---|---|
| 1 | Claude Opus 5 | 85,88 |
| 2 | Claude Mythos 5 | 83,01 |
| 3 | Claude Fable 5 | 82,76 |
| 4 | GPT-5.6 Sol | 81,46 |
| 6 | Claude Opus 4.8 | 77,44 |
Это единственное корректное прямое сравнение в статье: обе модели измерены по одной методике. Claude Opus 5 впереди — 85,88 против 81,46, разрыв чуть больше четырёх баллов. Но обратите внимание на плотность верхушки: с первого по четвёртое место умещаются четыре модели, и все они относятся к фронтиру. Разница в четыре балла сводного индекса не означает, что одна модель справится с вашей задачей, а вторая нет. Она означает, что в среднем по широкому набору сценариев Opus 5 стабильнее. Средняя температура по больнице полезна для ориентира и бесполезна для диагноза.
Где сильнее Claude Opus 5
Глубина рассуждений: когда задача не решается с первого взгляда
Это главная территория Opus 5. Показатели GPQA Diamond 93,2%, ARC-AGI-2 90,4%, ARC-AGI-1 97,5% и 64,7% на HLE с инструментами (по данным Anthropic и независимых замеров) описывают модель, которая удерживает многошаговую логику и не разваливается на нестандартных задачах. Идеальный результат на IMO 2026 — 42 из 42 — из той же серии. На практике это чувствуется там, где нужно не выдать ответ, а построить рассуждение: разобрать противоречивые требования, продумать архитектуру, найти дыру в юридической схеме, проверить чужую аналитику. Уровень усилий xhigh или max превращает быстрый ответ в развёрнутый разбор — именно за этим к Opus 5 и приходят.
Агентное программирование, ревью кода и длинные задачи
SWE-bench Verified 96,0%, SWE-bench Pro 79,2% и SWE-bench Multilingual 89,5% — это про работу с настоящими репозиториями, а не с учебными сниппетами. Toolathlon 80,6% и BrowseComp 90,8% дополняют картину по работе с инструментами и поиску информации. Отдельная сильная сторона — ревью кода и поиск багов: модель замечает то, что человек пропускает на пятом часу вычитки. Плюс мультиагентные схемы writer-verifier, когда один проход генерирует решение, а второй его критикует. Если вы приходите именно за разработкой, посмотрите практический гайд Claude Opus 5 для кода.
Длинный контекст, документы и «зрение»
Миллион токенов есть и у GPT-5.5, но у Opus 5 максимум стоит по умолчанию — не нужно ничего включать и следить за режимами. Это удобно, когда вы кидаете в чат годовой отчёт, свод регламентов или переписку по проекту целиком. Плюс «зрение»: MMMU-Pro 84,7% и заявленная сила в разборе графиков, документов и вёрстки означают, что скриншот дашборда или скан договора модель прочитает не хуже текста. Для офисных задач — сборка таблиц, структура презентаций, сведение данных из разных файлов — это связка, которая экономит больше всего времени.
Где сильны модели OpenAI
Начнём с честного признания: если бы Opus 5 выигрывал по всем осям, статья была бы короткой. У OpenAI две сильные карты. Первая — универсальность: четвёртое место GPT-5.6 Sol в рейтинге из 215 моделей означает, что это по-прежнему фронтир, а не догоняющий. Вторая — зрелость экосистемы: инструменты, интеграции и рабочие привычки огромного числа команд выстроены вокруг продуктов OpenAI, и модель, которую вся команда уже умеет промптить, часто выигрывает у формально более сильной, но незнакомой. По GPT-5.5 есть конкретика, и она убедительная: Terminal-Bench 2.0 82,7% — инженерная автоматизация и уверенная работа в командной строке; Expert-SWE 73,1% — экспертный уровень в разработке; GDPval 84,9% — профессиональные задачи широкого профиля, то есть ежедневная офисная и аналитическая рутина. Отдельно стоит удержание контекста: 74% против 36,6% у GPT-5.4 — рост более чем вдвое, и это ровно то, что чувствуется в длинных диалогах, когда модель перестаёт забывать условия, поставленные двадцать сообщений назад. Одноимённых замеров по этим тестам у Opus 5 нет, поэтому объявлять победителя мы не будем.
Кому какая модель подойдёт
| Задача | С чего начать | Почему |
|---|---|---|
| Стратегия, исследование, сложный разбор | Claude Opus 5, усилия high или xhigh | GPQA Diamond 93,2%, ARC-AGI-2 90,4%, HLE 64,7% по данным Anthropic и независимых замеров |
| Рефакторинг, ревью кода, поиск багов | Claude Opus 5 | SWE-bench Verified 96,0% и SWE-bench Pro 79,2%; сильная сторона — длинные агентные сессии |
| Автоматизация в терминале, инженерные пайплайны | GPT-5.5 | Terminal-Bench 2.0 82,7% и Expert-SWE 73,1% по публикациям о модели |
| Профессиональная рутина широкого профиля | Прогнать обе | У GPT-5.5 GDPval 84,9%; у Opus 5 сильные офисные сценарии — таблицы и презентации. Общего теста нет, сравнение только качественное |
| Огромный документ или репозиторий целиком | Claude Opus 5 или GPT-5.5 | У обеих контекст 1 млн токенов; у Opus 5 максимум включён по умолчанию |
| Универсальный повседневный ассистент | GPT-5.6 Sol | Четвёртое место в сводном рейтинге агрегатора (81,46) и универсальность семейства |
| Разбор скриншотов, графиков, сканов | Claude Opus 5 | MMMU-Pro 84,7% и заявленная сила в документах и вёрстке |
| Картинки, видео, озвучка | Раздел МедиаЛаб | Opus 5 отвечает только текстом; генерация визуала живёт в отдельном разделе платформы |
Как сравнить Claude Opus 5 и ChatGPT на своей задаче
- Возьмите одну настоящую рабочую задачу, а не тест из интернета: реальный документ, реальный баг, реальное письмо клиенту. Синтетические головоломки почти ничего не говорят о вашей рутине.
- Прогоните её в Claude Opus 5 с уровнем усилий high — это дефолт и хорошая отправная точка. Если ответ поверхностный, поднимите до xhigh или max; если нужна скорость, попробуйте вариант Claude Opus 5 Fast.
- Переключите модель на GPT-5.6 Sol или GPT-5.5 прямо в том же чате, одним кликом. Промпт переписывать не нужно — это принципиальный момент, иначе сравнение будет нечестным.
- Оцените по трём осям: точность фактов, структура ответа и объём правок, которые пришлось внести руками. Последняя ось — самая честная метрика.
- Отдельно проверьте длинный контекст: загрузите свой самый объёмный файл и спросите то, что лежит в его середине, а не в начале или конце.
- Повторите на трёх-пяти разных типах задач. Скорее всего, вы получите не одного победителя, а разделение ролей: одна модель для рассуждений, другая для рутины.
- Зафиксируйте выбор: сохраните удачный промпт в ассистента, чтобы не начинать заново каждый раз.
Главный аргумент здесь даже не в баллах. Спор «Claude или ChatGPT» существует только там, где нужно выбрать что-то одно, оплатить и потом жить с этим выбором. В СуперИнтеллекте Claude Opus 5, Opus 5 Fast, GPT-5.6, GPT-5.5, Kimi K3, Gemini 3.6 Flash, DeepSeek V4, GLM 5.2, Claude Fable 5, Sonnet 5 и GigaChat лежат в одном окне чата — из России, без VPN и без зарубежной карты, с оплатой нейронами и бесплатным стартом. Как настраивать уровни усилий и режимы, разобрано в гайде как пользоваться Claude Opus 5. Зарегистрируйтесь и проверьте обе модели на своей задаче — это займёт вечер и заменит десяток обзоров.
Частые вопросы
Claude Opus 5 действительно лучше ChatGPT?
По сводному рейтингу независимого агрегатора из 215 моделей — да: Opus 5 на первом месте с 85,88 балла, GPT-5.6 Sol на четвёртом с 81,46. Но это усреднённый индекс по широкому набору сценариев. По одноимённым бенчмаркам сравнить модели почти невозможно: Anthropic и OpenAI публикуют разные тесты, и замеры делают разные стороны в разных условиях. Практический ответ такой: для глубоких рассуждений, агентного программирования и длинного контекста Opus 5 — более сильный кандидат; для универсальной ежедневной работы модели OpenAI остаются отличным выбором. Разница на вашей конкретной задаче может оказаться меньше, чем разница между хорошим и плохим промптом.
Можно ли пользоваться Claude Opus 5 в России без VPN?
Да. В СуперИнтеллекте Claude Opus 5 и модели OpenAI доступны из России без VPN и без зарубежной банковской карты — оплата идёт нейронами, есть бесплатный старт: начать можно на бесплатном тарифе. Переключение между моделями занимает один клик, и промпт при этом переписывать не нужно: можно задать вопрос Opus 5, получить ответ, тут же переключиться на GPT-5.6 и сравнить формулировки в том же диалоге. Если вы только начинаете, загляните в обзор Claude Opus 5 и в материал что такое Claude Opus 5.
У кого больше контекст — у Opus 5 или у GPT-5.5?
Формально одинаково: миллион токенов у обеих. Нюанс в деталях. У Claude Opus 5 максимальное окно установлено по умолчанию — ничего включать не нужно, а вывод может достигать 128 тысяч токенов за ответ. У GPT-5.5 контекст тоже миллион, но в среде Codex он ограничен 400 тысячами; зато у неё отдельно заявлено удержание контекста 74% против 36,6% у GPT-5.4, то есть модель заметно лучше помнит середину длинного диалога. Одноимённого теста на удержание контекста у этих двух моделей нет, поэтому проверять стоит на своём документе.
Умеет ли Claude Opus 5 генерировать изображения?
Нет. Opus 5 принимает на вход текст, изображения и файлы, но отвечает только текстом: картинки, видео и аудио он не создаёт. Разбирать графики, читать сканы и оценивать вёрстку по скриншоту — умеет, и делает это хорошо (MMMU-Pro 84,7% по данным Anthropic и независимых замеров). Для генерации визуала в СуперИнтеллекте есть отдельный раздел МедиаЛаб. А если интересно, чем Opus 5 отличается от соседей по семейству, посмотрите материалы чем отличаются модели Claude, Opus 5 против Sonnet 5 и Opus 5 против Fable 5.
Итог без лишней драмы: Claude Opus 5 занимает первое место в сводном рейтинге независимого агрегатора и выигрывает там, где нужна глубина — сложные рассуждения, агентная разработка, длинный контекст, разбор документов. Модели OpenAI остаются сильным универсальным инструментом с отличными показателями GPT-5.5 в терминальных и профессиональных задачах. Прямых дуэлей по одноимённым бенчмаркам между ними почти нет, и любой, кто утверждает обратное, скорее всего сравнивает разные экзамены. Единственный способ узнать правду про свою работу — прогнать через обе модели свою же задачу. Начните бесплатно и сравните сами. А если хочется расширить кругозор дальше OpenAI, посмотрите ещё сравнение Claude Opus 5 с Gemini.