Перейти к содержимому

Обучения

Claude Opus 5.5 vs Opus 5: что изменилось и стоит ли переходить

Claude Opus 5.5 vs Opus 5: что изменилось в новой модели Anthropic. Сводная таблица бенчмарков, где прирост большой и где скромный, насколько 5.5 быстрее и экономнее, как изменились стиль и безопасность и как перейти в СуперИнтеллекте за один клик.

Команда СуперИнтеллекта · · ~8 мин

Claude Opus 5.5 vs Opus 5: новая модель, вышедшая 22 сентября 2026 года, сильнее предшественницы во всех девяти тестах из анонса Anthropic, генерирует ответ более чем на 30% быстрее и, по данным Anthropic, при настройках по умолчанию обходится на типичных задачах примерно на 40% дешевле — поэтому переходить стоит почти всем. Сильнее всего прирост в агентном программировании и научных задачах в терминале, скромнее всего — в междисциплинарных рассуждениях. В СуперИнтеллекте переход — одно переключение модели в том же чате, без переписывания промптов.

  • Качество: прирост во всех девяти тестах из анонса.
  • Экономия: токен на 20% дешевле, а токенов на задачу нужно меньше.
  • Стиль: меньше воды, главное — в начале.
  • Безопасность: устойчивее к prompt injection — подмене инструкций через содержимое, которое модель читает по ходу задачи.

Чем Claude Opus 5.5 отличается от Opus 5?

Opus 5.5 — прямая преемница Opus 5 и первая модель нового семейства Claude 5.5: она сильнее в каждом тесте из анонса, дешевле и быстрее. Ниже — сводка по данным Anthropic.

ПараметрClaude Opus 5Claude Opus 5.5
Цена токенабазовый уровеньна 20% ниже
Чтение из кэшабазовый уровеньна 60% дешевле
Стоимость типичной задачи при настройках по умолчаниюбазовый уровеньпримерно на 40% ниже
Скорость генерации ответабазовый уровеньболее чем на 30% выше
Доступ в СуперИнтеллектес тарифа Прос тарифа Про
Характеристики: Opus 5 и Opus 5.5

Контекст у Opus 5.5 — 1 000 000 токенов, ответ — до 128 000. На вход — текст, изображения и файлы. Уровни рассуждений — от low до max; у Anthropic по умолчанию medium, в СуперИнтеллекте уровень выбирается в чате.

ТестЧто проверяетOpus 5Opus 5.5Разница
Terminal-Bench 4.0агентное программирование в терминале52,3%66,4%+14,1 п. п.
Terminal-Bench-Science 0.1научные задачи в терминале29,0%58,7%+29,7 п. п.
CursorBench 4.0работа в редакторе кода46,6%57,8%+11,2 п. п.
AutomationBenchбизнес-автоматизации26,9%40,0%+13,1 п. п.
FrontierCode v1.1 (Main)агентное программирование48,0%54,4%+6,4 п. п.
OSWorld 2.0управление компьютером74,0%81,8%+7,8 п. п.
Chartographyраспознавание графиков, с инструментами83,4%89,0%+5,6 п. п.
Humanity's Last Examмеждисциплинарные рассуждения, с инструментами63,6%67,7%+4,1 п. п.
GDPval-AA v2.1офисная работа в 44 профессиях, Elo17081846+138 Elo
Бенчмарки: Opus 5 и Opus 5.5

Насколько Opus 5.5 умнее Opus 5?

Заметно умнее в агентных задачах, где модель сама работает в терминале или редакторе кода, и умеренно — в чистых рассуждениях.

Где прирост большой

Самый резкий скачок — в Terminal-Bench-Science: результат вырос с 29,0% до 58,7%, то есть более чем вдвое. В Terminal-Bench 4.0 прибавка — 14,1 пункта, в CursorBench — 11,2 пункта, в тесте бизнес-автоматизаций AutomationBench — 13,1 пункта. Это задачи, где модель долго действует сама: запускает команды, читает вывод, исправляет ошибки.

В задаче ускорить загрузку всех страниц веб-приложения Opus 5.5 справилась 39 раз из 40, а Opus 5 добивалась меньших улучшений и попутно меняла поведение приложения — то есть трогала то, о чём её не просили. При подготовке отчёта о квартальных результатах компании по сохранённой копии веба, где пресс-релиз трудно найти, 16 из 18 отчётов Opus 5.5 прошли проверку без единой выдуманной цифры или цитаты. У Opus 5 таких отчётов не оказалось ни одного.

В Deloitte Opus 5.5 на самом низком уровне усилий нашла при ревью 72% известных багов, а Opus 5 на высоком — 56%. В Hebbia на сквозных финансовых процессах новая модель выполнила 86,6% требований против 60,3% у Opus 5.

Честная оговорка: в AutomationBench и Terminal-Bench-Science впереди всё же GPT-6 Astra — 41,4% и 64,6% (на уровне high, по данным OpenAI). Подробности — в сравнении Opus 5.5 с GPT-6 Astra и GPT-5.6 Sol.

Где прирост скромный

В Humanity's Last Exam — экзамене на междисциплинарные рассуждения — Opus 5.5 прибавила 4,1 пункта: 67,7% против 63,6%. Близкие по масштабу прибавки — в распознавании графиков Chartography (5,6 пункта) и в FrontierCode (6,4 пункта). Если вы в основном задаёте сложные вопросы без долгой работы с инструментами, скорость и экономию вы заметите сильнее, чем рост качества.

Насколько Opus 5.5 быстрее и дешевле Opus 5?

По данным Anthropic, при настройках по умолчанию типичная задача на Opus 5.5 обходится примерно на 40% дешевле, а ответ генерируется более чем на 30% быстрее. Экономия складывается из двух частей: модели нужно меньше токенов на ту же задачу, а сам токен стоит на 20% меньше, чтение из кэша — на 60% меньше.

Как это выглядит на реальной работе:

  • Аудит и исправление кодовой базы на 200 000 строк. Opus 5.5 уложилась меньше чем в три часа. Opus 5 понадобилось больше 20 часов и в 2,5 раза больше токенов.
  • Анализ слияния двух вымышленных HR-компаний — модель в Excel и презентация. Выводы у моделей совпали, но Opus 5.5 проработала расчёт тщательнее и сделала презентацию понятнее, а у Opus 5 нашлись мелкие ошибки. Время — 63 минуты против 93, стоимость — вдвое ниже.

Ещё важнее, что Opus 5.5 часто обходит Opus 5 на более низком уровне усилий. В Terminal-Bench 4.0 она на уровне по умолчанию обходит Opus 5 на максимальном примерно за пятую часть стоимости. В Rogo на самом низком уровне обошла Opus 5 на высоком примерно с 60% меньшим числом выходных токенов, а в Box тратила треть токенов Opus 5 при ответах на 40% короче без потери точности.

В СуперИнтеллекте оплата идёт нейронами, и их расход зависит от числа токенов. Чем меньше токенов модель тратит на задачу, тем меньше нейронов уходит, поэтому экономность Opus 5.5 чувствуется напрямую.

Как изменился стиль ответов Opus 5.5?

Opus 5.5 пишет короче и по делу: главной претензией к Opus 5 была многословность, и в новой версии Anthropic взялась именно за неё. Модель выносит главное в начало, реже прибегает к жаргону и странным оборотам и соблюдает правила письма, которые ей задали. В Ramp отмечают, что она пишет как хороший коллега и держится правил, принятых в команде.

Объяснение одного и того же бага: ответы Claude Opus 5 и Claude Opus 5.5 рядом. Источник: anthropic.com
Объяснение одного и того же бага: ответы Claude Opus 5 и Claude Opus 5.5 рядом. Источник: anthropic.com

Anthropic показывает три такие пары: объяснение бага, пересказ рабочего треда и объяснение изменения в дизайне. Все три мы разобрали в статье о том, как пишет Claude Opus 5.5.

Opus 5.5 безопаснее Opus 5?

Да, по данным Anthropic: Opus 5.5 устойчивее Opus 5 к prompt injection и реже выходит за заданные границы. Prompt injection — это подмена инструкций через содержимое: например, в веб-странице или документе, который модель читает по ходу задачи, спрятана команда «забудь задание и сделай другое». Для агентов, которые сами открывают сайты и файлы, это главный риск.

  • В тесте Gray Swan Opus 5.5 делит с Fable 5.1 самый низкий процент успешных атак среди всех проверенных моделей.
  • В новом тесте на пересечение границ «песочницы» попыток примерно на 85% меньше, чем у Opus 5 и Claude Mythos 5.1. Все они малой серьёзности, и модель сама о них сообщала.
  • Модель реже совершает трудно обратимые действия — те, что потом не откатить.
  • В автоматическом аудите поведения почти на 2 000 сценариев — лучший результат среди последних моделей Claude почти по всем мерам, в том числе по большинству мер честности. До выпуска модель проверяли и внешние организации, включая METR.

Две оговорки. Первая — от самой Anthropic: модель часто подозревает, что её тестируют, и это усложняет оценку её поведения в реальных условиях. Вторая касается границ: обычное исправление ошибок в коде работает, но большинство задач по кибербезопасности Opus 5.5 прозрачно передаёт Opus 4.8, а работа с биологическими исследованиями открыта только проверенным организациям.

Когда Opus 5 всё ещё может пригодиться?

По качеству и цене — почти никогда: ни в одном тесте из анонса Opus 5.5 не уступает предшественнице. Повод задержаться на Opus 5 бывает не технический, а рабочий:

  • Отлаженный агент, который вас устраивает. Если промпт и формат ответа долго подгонялись под Opus 5, сначала прогоните Opus 5.5 на нескольких типичных задачах этого агента.
  • Промпты против многословности. Указания вроде «максимально коротко» писались для Opus 5. Новая модель и так пишет плотнее, и ответ может выйти суше, чем нужно, — перечитайте такие указания.
  • Серия документов в едином стиле. Если пакет готов наполовину, его разумно закончить на прежней модели.

Во всех трёх случаях переход откладывается, а не отменяется: обе модели лежат в одном списке, и вернуться к Opus 5 можно тем же кликом.

Как перейти с Opus 5 на Opus 5.5 в СуперИнтеллекте?

Откройте чат или агента на Opus 5 и переключите модель в списке — промпты переписывать не придётся. Модель появилась в каталоге в день выхода, 22 сентября, и доступна с тарифа Про.

  1. Выберите модель: «Claude Opus 5.5» — конкретная версия, «Claude Opus Latest» — псевдоним, который всегда ведёт на свежую Opus (сейчас уже на 5.5). С ним при выходе следующей версии ничего перенастраивать не придётся.
  2. Выберите уровень рассуждений. Начните с medium — это умолчание Anthropic, а в Factory называют Opus 5.5 первой моделью, которую готовы по умолчанию держать на medium. Высокие уровни — для длинных многошаговых задач.
  3. Сравните на своей задаче: отправьте один и тот же запрос сначала на Opus 5, потом на Opus 5.5 — переключение между ними занимает один клик в том же чате.

Сравнивайте точность, длину ответа и расход нейронов. Подробнее о настройке — в инструкции по Claude Opus 5.5.

Итог: стоит ли переходить с Opus 5 на Opus 5.5?

Да. Opus 5.5 сильнее Opus 5 во всех девяти тестах из анонса, пишет короче, устойчивее к подмене инструкций и, по данным Anthropic, примерно на 40% дешевле на типичных задачах. Для новых чатов и агентов закрепите «Claude Opus Latest» — тогда следующий переход случится сам. Отлаженных агентов на Opus 5 переключайте после короткой проверки на своих задачах. Если выбираете между Opus 5.5 и Fable 5.1 — читайте отдельное сравнение.


Бесплатная экскурсия · онлайн · до часа

Посмотрите, как это работает на ваших задачах

Эксперт по внедрению покажет платформу вживую: ИИ-агенты, базы знаний, генерация контента и интеграции — на примерах именно ваших процессов. Без обязательств.

  • Разберём 2–3 ваших процесса и покажем, что автоматизируется уже сейчас
  • После встречи — запись, мини-план внедрения и подборка агентов
  • Экскурсию проводит эксперт по внедрению, а не менеджер по продажам

Не готовы к встрече? Пройдите квиз «Готов ли бизнес к ИИ» — получите персональный отчёт и бонусные нейроны за 2 минуты.

Запишитесь на экскурсию

Свяжемся в течение рабочего дня и подберём удобное время.

Защищено reCAPTCHA: Конфиденциальность · Условия