Перейти к содержимому

Claude Opus 5 против Kimi K3: что выбрать

Claude Opus 5 и Kimi K3 вышли с разницей в неделю: у обеих контекст 1 млн токенов и ставка на код и агентов. Разбираем, где сравнение честное (GPQA Diamond 93,2 против 93,5), где цифры несопоставимы и кому какая модель подойдёт. Обе — в одном окне чата.

· ~12 мин

Claude Opus 5 и Kimi K3 — две топовые модели июля 2026 года с контекстом в 1 000 000 токенов, и обе сильны в программировании и агентных задачах. Claude Opus 5 (Anthropic, 23 июля 2026) — проприетарный флагман с «мышлением», включённым по умолчанию, и первым местом (85,88 балла) в сводном рейтинге независимого агрегатора из 215 моделей. Kimi K3 (MoonshotAI, 16 июля 2026) — одна из крупнейших открытых моделей: 2,8 трлн параметров в архитектуре MoE и первое место в Arena Frontend Code. Напрямую сопоставить их можно всего по двум одноимённым тестам: GPQA Diamond (93,2 у Opus 5 против 93,5 у Kimi K3) и BrowseComp (90,8 против 91,2), причём замеры выполнялись разными сторонами. Обе модели работают в одном окне чата СуперИнтеллекта — из России, без VPN и зарубежной карты.

Claude Opus 5 и Kimi K3: в чём принципиальная разница?

Между релизами прошла неделя, и целятся модели в одну аудиторию: разработчики, аналитики, авторы агентных сценариев. Совпадений много — миллион токенов контекста, ставка на код и автономную работу с инструментами. Разница проходит по трём линиям. Первая — доступ к весам: Kimi K3 открытая, Claude Opus 5 закрытый. Вторая — приоритет: Anthropic оптимизирует глубину и надёжность на длинной дистанции, MoonshotAI — масштаб модели и практическую силу в генерации кода. Третья — набор опубликованных замеров: у Opus 5 он заметно шире, что даёт больше точек опоры, но парадоксальным образом затрудняет честное сопоставление, потому что общих тестов у моделей всего два.

Что такое Claude Opus 5?

Claude Opus 5 — флагманская модель Anthropic, вышедшая 23 июля 2026 года. Ключевая особенность: «мышление» включено по умолчанию, а глубину рассуждения регулируют пять уровней усилий — low, medium, high, xhigh и max, по умолчанию high. Контекст равен 1 000 000 токенов, причём максимум стоит дефолтом: не нужно вручную расширять окно перед загрузкой большого репозитория или пакета документов. Вывод — до 128 000 токенов за ответ. На вход модель принимает текст, изображения и файлы, на выходе даёт только текст. В сводном рейтинге независимого агрегатора, ранжирующего 215 моделей, Opus 5 занимает первое место с 85,88 балла; следом идут Claude Mythos 5 (83,01), Claude Fable 5 (82,76) и GPT-5.6 Sol (81,46), а предыдущий флагман Claude Opus 4.8 — шестым с 77,44. Подробные разборы — в материалах обзор Claude Opus 5 и что умеет Claude Opus 5.

  • Контекст 1 000 000 токенов, по умолчанию равен максимуму; вывод — до 128 000 токенов
  • «Мышление» включено по умолчанию, пять уровней усилий: low, medium, high, xhigh, max (дефолт — high)
  • Вход: текст, изображения, файлы. Выход: только текст
  • Сильные стороны: глубокие рассуждения, агентное программирование и длинные задачи, ревью кода и поиск багов, длинный контекст, офисные задачи (таблицы, презентации), мультиагентные схемы writer-verifier, «зрение» по графикам, документам и вёрстке
  • Результаты по данным Anthropic и независимых замеров: SWE-bench Verified 96,0%, SWE-bench Pro 79,2%, SWE-bench Multilingual 89,5%, BrowseComp 90,8%, Toolathlon 80,6%, GPQA Diamond 93,2%, ARC-AGI-2 90,4%, ARC-AGI-1 97,5%, MMMU-Pro 84,7%, HLE (с инструментами) 64,7%, IMO 2026 — 42 из 42

Что такое Kimi K3?

Kimi K3 — модель MoonshotAI, представленная 16 июля 2026 года, и одна из крупнейших открытых моделей на сегодня: 2,8 трлн параметров в архитектуре MoE (смесь экспертов), то есть на каждый запрос активируется лишь часть сети. Контекстное окно — 1 000 000 токенов. На платформе СуперИнтеллект Kimi K3 принимает текст и изображения. По данным разработчика и ранних независимых замеров: GPQA Diamond 93,5, BrowseComp 91,2, Terminal-Bench 88,3, а также первое место в Arena Frontend Code — рейтинге фронтенд-задач. Заявленные сильные стороны: код, агентные сценарии, длинный контекст.

  • 2,8 трлн параметров, архитектура MoE; открытая модель
  • Контекст 1 000 000 токенов
  • Вход на нашей платформе: текст и изображения. Выход: только текст
  • Сильные стороны: программирование (особенно фронтенд), агентные цепочки, работа с длинным контекстом
  • Результаты по данным разработчика и ранних замеров: GPQA Diamond 93,5, BrowseComp 91,2, Terminal-Bench 88,3, 1-е место в Arena Frontend Code

Таблица: чем отличаются Claude Opus 5 и Kimi K3

ПараметрClaude Opus 5Kimi K3
Разработчик и дата выходаAnthropic, 23 июля 2026MoonshotAI, 16 июля 2026
Тип моделиПроприетарный флагманОткрытая модель
Архитектура и размерПублично не раскрывается2,8 трлн параметров, MoE
Контекстное окно1 000 000 токенов (по умолчанию = максимум)1 000 000 токенов
Максимальный выводДо 128 000 токеновОтдельно не заявлен
Управление глубиной рассуждения«Мышление» включено по умолчанию, 5 уровней усилий (деф. high)Публичных данных нет
ВходТекст, изображения, файлыТекст, изображения
ВыходТолько текстТолько текст
Сводный рейтинг агрегатора (215 моделей)1-е место, 85,88 баллаВ доступной выдержке топ-6 не фигурирует
Заявленные сильные стороныРассуждения, агентное программирование, ревью кода, длинный контекст, офисные задачи, «зрение»Код (особенно фронтенд), агенты, длинный контекст
Характеристики по данным Anthropic (Claude Opus 5), MoonshotAI (Kimi K3) и независимого агрегатора моделей. Состав поддерживаемых входов указан для платформы СуперИнтеллект.

Обратите внимание на строки про вход и выход. Ни Opus 5, ни Kimi K3 не создают изображения, видео или звук — обе отвечают текстом, даже когда картинка была на входе. Для генерации визуала на платформе есть отдельный раздел МедиаЛаб. Путать эти вещи не стоит: иначе в ответ на просьбу «нарисуй» вы получите подробное словесное описание вместо самого изображения.

Какие бенчмарки Claude Opus 5 и Kimi K3 можно сравнивать напрямую?

Здесь начинается самая аккуратная часть сравнения. Цифры Opus 5 публикует Anthropic, часть подтверждают независимые замеры; цифры Kimi K3 идут от MoonshotAI и ранних сторонних прогонов. Это разные лаборатории, разные обвязки, разные настройки числа попыток и доступных модели инструментов. Сопоставлять корректно только одноимённые тесты, и даже в этом случае разрыв в доли процентного пункта ничего не доказывает. Общих тестов у наших героев в доступных публикациях ровно два: GPQA Diamond и BrowseComp.

ТестClaude Opus 5Kimi K3Прямое сравнение
GPQA Diamond93,293,5Да, с оговоркой о разных замерах
BrowseComp90,891,2Да, с оговоркой о разных замерах
SWE-bench Verified96,0%Числа нетНет
SWE-bench Pro79,2%Числа нетНет
SWE-bench Multilingual89,5%Числа нетНет
Terminal-BenchЧисла нет88,3Нет
Toolathlon80,6%Числа нетНет
ARC-AGI-2 / ARC-AGI-190,4% / 97,5%Чисел нетНет
MMMU-Pro84,7%Числа нетНет
HLE (с инструментами)64,7%Числа нетНет
IMO 202642 из 42Числа нетНет
Arena Frontend CodeПозиции нет1-е местоНет
Опубликованные результаты: Claude Opus 5 — по данным Anthropic и независимых замеров; Kimi K3 — по данным MoonshotAI и ранних сторонних прогонов. Столбец «Прямое сравнение» показывает, где сопоставление методологически корректно.

Разница по GPQA Diamond — 0,3 процентного пункта в пользу Kimi K3, по BrowseComp — 0,4 пункта, тоже в её пользу. На таких дистанциях единственный честный вывод: по сложным научным вопросам и по многошаговому поиску в вебе модели идут вровень, и на вашем конкретном наборе задач лидер вполне может смениться. Практический смысл этих строк не в том, кто выше на 0,3 балла, а в том, что обе модели относятся к верхнему эшелону, а выбирать между ними придётся по другим критериям: формат задач, длина сессий, требования к предсказуемости.

Кто сильнее в коде: Claude Opus 5 или Kimi K3?

Агентное программирование и длинные задачи

У Claude Opus 5 опубликована самая полная линейка кодовых замеров: SWE-bench Verified 96,0%, SWE-bench Pro 79,2%, SWE-bench Multilingual 89,5% и Toolathlon 80,6% (данные Anthropic и независимых замеров). У Kimi K3 в открытых материалах — Terminal-Bench 88,3. Это разные бенчмарки: первый набор проверяет починку реальных задач в репозиториях и работу с инструментами, второй — действия в терминале. Складывать и вычитать их нельзя. Качественно картина такая: Opus 5 проектировался под длинные автономные сессии — многочасовой рефакторинг, миграции, ревью пул-реквестов, поиск редких багов, а также мультиагентные схемы вида writer-verifier, где одна роль пишет, а вторая проверяет и спорит. Включённое по умолчанию «мышление» и регулируемые уровни усилий здесь работают как ручка «думай дольше там, где цена ошибки высокая». Kimi K3 тоже уверенно ведёт агентные цепочки и заметно сильна в генерации кода. Готовые сценарии и промпты под Opus 5 разобраны в гайде Claude Opus 5 для кода.

Фронтенд, вёрстка и интерфейсы

Здесь у Kimi K3 есть аргумент, которого у Opus 5 попросту нет: первое место в Arena Frontend Code — рейтинге, посвящённом задачам вёрстки и интерфейсов. Если ваша ежедневная работа — быстро получать рабочие компоненты, страницы и прототипы UI, начните тест именно с Kimi K3. У Opus 5 сильная сторона рядом, но другой природы — «зрение»: модель разбирает скриншоты интерфейсов, макеты, графики и документы (MMMU-Pro 84,7 по данным Anthropic и независимых замеров), поэтому хорошо отрабатывает связку «покажи скриншот сломанной вёрстки — получи диагноз, объяснение причины и правку». На практике это два разных рабочих движения: сгенерировать интерфейс и починить существующий.

Как обе модели работают с контекстом в 1 000 000 токенов?

Формально окно одинаковое — миллион токенов у каждой. Практически важны две вещи: как модель удерживает внимание на длинной дистанции и что происходит по умолчанию. У Opus 5 максимальное окно стоит дефолтом, а вывод до 128 000 токенов позволяет вернуть большой артефакт целиком — полный разбор договора, переписанный модуль, длинную аналитическую записку без нарезки на части. Публичных цифр по удержанию контекста для Kimi K3 в доступных нам данных нет, поэтому единственный честный способ сравнить — прогнать один и тот же длинный материал через обе модели и спросить о фрагментах из начала, середины и конца.

  • Загрузите один и тот же материал (репозиторий, свод регламентов, годовую переписку) в обе модели
  • Задайте три вопроса: по факту с первых страниц, по факту из середины, по факту с самого конца
  • Попросите свести противоречия между разными частями документа — это проверка связности, а не поиска
  • Сравните, кто раньше начинает терять детали и кто честнее признаёт, что данных в материале нет

Кому подойдёт Claude Opus 5?

Opus 5 — выбор там, где надёжность важнее скорости, а задача не заканчивается одним ответом. Проприетарная модель означает предсказуемое поведение «из коробки» и максимум по сумме способностей: первое место с 85,88 балла в сводном рейтинге агрегатора из 215 моделей — это именно про широту, а не про один тест.

  • Длинные автономные задачи: многочасовой рефакторинг, миграции, разбор легаси-кода
  • Ревью кода и поиск редких багов, где цена ошибки выше цены минуты ожидания
  • Аналитика и исследования: глубокие рассуждения, сложные научные вопросы, работа с источниками
  • Офисные задачи: таблицы, презентации, длинные документы с выводом до 128 000 токенов
  • Работа с визуалом на входе: графики, скриншоты, сканы, макеты и вёрстка
  • Мультиагентные схемы writer-verifier, где нужна дисциплина исполнения инструкций
  • Ситуации, когда важно регулировать глубину: от low для рутины до max для по-настоящему трудных задач

Кому подойдёт Kimi K3?

Kimi K3 — выбор тех, кому нужны сильный практический код и открытая модель. Открытость здесь не абстракция: это прозрачность происхождения, возможность изучать и воспроизводить поведение модели, отсутствие зависимости от одного вендора в долгую. Плюс сильный сигнал по фронтенду.

  • Фронтенд и интерфейсы: первое место в Arena Frontend Code по данным разработчика
  • Генерация кода и агентные цепочки, где важна практическая скорость получения результата
  • Проекты, где принципиальна открытая модель — прозрачность и независимость от одного поставщика
  • Работа с большими массивами текста: контекст 1 000 000 токенов
  • Сложные вопросы уровня GPQA и многошаговый веб-поиск: 93,5 и 91,2 по данным разработчика и ранних замеров — фактически вровень с Opus 5
  • Сценарии, где нужно второе независимое мнение к ответу Opus 5 — перекрёстная проверка двумя топ-моделями

Как выбрать между Opus 5 и Kimi K3 за один вечер?

Выбирать вслепую по чужим бенчмаркам — худшая из стратегий: чужие тесты измеряют чужие задачи. В СуперИнтеллекте обе модели живут в одном окне чата, переключение занимает один клик, промпты переписывать не нужно, оплата идёт нейронами, а старт бесплатный. Значит, честный эксперимент стоит одного вечера, а не недели переговоров о доступах.

  1. Возьмите три своих реальных задачи: одну кодовую, одну с длинным документом, одну аналитическую.
  2. Прогоните каждую через Claude Opus 5 — «мышление» уже включено, при необходимости поднимите усилия до xhigh или max.
  3. Переключите модель на Kimi K3 в том же чате и повторите те же промпты без единого изменения.
  4. Сравните по четырём критериям: корректность, полнота, следование инструкции и то, насколько легко вам проверить ответ.
  5. Зафиксируйте выбор по типам задач, а не «навсегда». У большинства команд получается сплит: одна модель на интерфейсы и быстрый код, другая — на разбор, ревью и длинные сессии.

Если ни один из двух вариантов не закрывает задачу, в том же окне есть и другие флагманы. Gemini 3.6 Flash делает ставку на скорость и нативно принимает на вход текст, изображения, аудио и видео — это про восприятие материала, а не про генерацию картинок или роликов. GPT-5.5 и GPT-5.6 Sol от OpenAI — сильные универсалы, у GPT-5.5 контекст тоже достигает миллиона токенов. DeepSeek V4 Flash сделан ради скорости и экономичности при окне в 1 млн токенов, GLM 5.2 — рассуждающая модель с таким же окном, а Claude Fable 5, Sonnet 5 и GigaChat закрывают остальные сценарии. Сравнивать их между собой по разным бенчмаркам бессмысленно, а вот прогнать один и тот же промпт — дело пары минут.


Частые вопросы о Claude Opus 5 и Kimi K3

Что лучше для программирования — Claude Opus 5 или Kimi K3?

Из бенчмарков прямой ответ не следует: общего кодового теста у моделей нет. По данным Anthropic у Opus 5 SWE-bench Verified 96,0% и SWE-bench Pro 79,2%, у Kimi K3 заявлены Terminal-Bench 88,3 и первое место в Arena Frontend Code — это разные измерения, и переводить одно в другое нельзя. Практическое правило: длинные автономные задачи, ревью и поиск багов — Opus 5; быстрый фронтенд и генерация интерфейсов — Kimi K3. Окончательный вывод стоит делать на своём коде.

Правда ли, что Kimi K3 обходит Claude Opus 5 по GPQA Diamond?

По опубликованным цифрам — да: 93,5 против 93,2. Но разрыв составляет 0,3 процентного пункта, а замеры выполнялись разными сторонами и в разных условиях. Корректная формулировка: по GPQA Diamond модели идут вровень. Такая же картина по BrowseComp — 91,2 против 90,8. Разницу такого размера нельзя считать доказательством превосходства.

У обеих моделей контекст 1 млн токенов — значит, они одинаково справятся с большим проектом?

Нет. Размер окна — это ёмкость, а не качество внимания на длинной дистанции. У Opus 5 максимальное окно стоит по умолчанию, а вывод достигает 128 000 токенов, что удобно для больших итоговых артефактов. Как каждая модель удерживает связность именно на ваших материалах, покажет только тест: одинаковый документ, вопросы по началу, середине и концу, задание свести противоречия.

Могут ли Claude Opus 5 или Kimi K3 сгенерировать изображение или видео?

Нет. Обе модели отвечают только текстом. Изображения они разбирают на входе — Opus 5 дополнительно принимает файлы, — но не создают. Для генерации визуала на платформе есть отдельный раздел МедиаЛаб, и это принципиально разные инструменты.

Нужны ли VPN и зарубежная карта, чтобы работать с этими моделями из России?

Нет. Claude Opus 5 и Opus 5 Fast, Kimi K3, Gemini 3.6 Flash, GPT-5.6 и GPT-5.5, DeepSeek V4, GLM 5.2, Claude Fable 5, Sonnet 5 и GigaChat доступны в СуперИнтеллекте без VPN и без зарубежной карты. Оплата — нейронами, есть бесплатный старт. Как начать работу с флагманом, разобрано в гайде как пользоваться Claude Opus 5.

Если хотите сравнить Opus 5 с другими флагманами, у нас есть отдельные разборы: Claude Opus 5 против GPT-5.6, против Gemini, против Fable 5 и против Sonnet 5. Если вы только знакомитесь с линейкой, начните с материалов что такое Claude Opus 5 и чем отличаются модели Claude. А самый быстрый способ определиться — открыть чат и задать обеим моделям один и тот же вопрос.

Бесплатная экскурсия · онлайн · до часа

Посмотрите, как это работает на ваших задачах

Эксперт по внедрению покажет платформу вживую: ИИ-агенты, базы знаний, генерация контента и интеграции — на примерах именно ваших процессов. Без обязательств.

  • Разберём 2–3 ваших процесса и покажем, что автоматизируется уже сейчас
  • После встречи — запись, мини-план внедрения и подборка агентов
  • Экскурсию проводит эксперт по внедрению, а не менеджер по продажам

Не готовы к встрече? Пройдите квиз «Готов ли бизнес к ИИ» — получите персональный отчёт и бонусные нейроны за 2 минуты.

Запишитесь на экскурсию

Свяжемся в течение рабочего дня и подберём удобное время.

Защищено reCAPTCHA: Конфиденциальность · Условия

Claude Opus 5 или Kimi K3: что выбрать в 2026 — СуперИнтеллект