Grok 4.6 вышла 12 августа 2026 года, и первое, что стоит знать про сравнение с 4.5: доплачивать за обновление не придётся. В каталоге СуперИнтеллекта Grok 4.6 стоит те же 270 нейронов за миллион входных токенов и 810 за миллион выходных, что и 4.5. Контекст тоже прежний — 500 000 токенов. Вопрос, значит, не «дороже ли», а «лучше ли и в чём именно».

По качеству разрыв заметный. Индекс Artificial Analysis Intelligence у Grok 4.6 — 61 против 56 у 4.5, то есть пять пунктов за месяц. У Grok 4.3 индекс на 23 пункта ниже, чем у 4.6, так что за две версии линейка прошла большой путь — предыдущий шаг мы разбирали в обзоре Grok 4.5.

И сразу про потолок: 61 — не первое место. Столько же у GPT-5.6 Sol Max, выше стоят Claude Opus 5 с 63 и Claude Fable 5. По индексу Artificial Analysis Grok 4.6 третья, поэтому «лучшая модель на рынке» — это не про неё. Зато среди того, что открыто на тарифе за 890 ₽, она самая сильная; к этому вернёмся в конце.

Что именно выросло: замеры построчно

ЗамерGrok 4.5Grok 4.6
Artificial Analysis Intelligence Index5661
GDPval-AA v2, Elo15261753
AA-Briefcase, Elo13131577
DeepSWE v1.1на 11,9 пункта ниже65,9%
Terminal-Bench v3.015,7%26%
Публичные замеры двух версий

Крупнее всего прирост в двух Elo-замерах: GDPval-AA v2 — 1753 против 1526, AA-Briefcase — 1577 против 1313. По GDPval-AA v2 впереди Grok 4.6 остаётся только Claude Opus 5. В собственной таблице xAI из десяти строк Grok 4.6 берёт первые места в работе со знаниями и в юридических задачах — если это ваш профиль, прирост вы увидите в первую очередь здесь.

С терминалом сложнее, и здесь легко запутаться в версиях бенчмарка. На Terminal-Bench v3.0 у 4.6 — 26%, у 4.5 — 15,7%, почти вдвое лучше. На более старой и простой v2.1 та же модель даёт 88,4%. Цифры между версиями несопоставимы: если вам показывают «88%», уточняйте версию, ориентироваться стоит на свежую.

Цена, контекст и доступ: здесь не изменилось ничего

ПараметрGrok 4.5Grok 4.6
Нейронов за 1 млн входных токенов270270
Нейронов за 1 млн выходных токенов810810
Контекст500 000 токенов500 000 токенов
Уровень доступаSTANDARDSTANDARD
Категория в каталогеLEGACY (устаревшая)FLAGSHIP
Параметр reasoning_effortнетесть
Параметры доступа и интерфейса

Цена в нейронах — это официальные 2 и 6 долларов за миллион токенов у xAI с нашей наценкой, цифры сходятся. Уровень доступа у обеих версий STANDARD, то есть обе открыты с тарифа «Старт» за 890 ₽. Идентификатор новой версии — x-ai/grok-4.6-20260810, в списке она подписана «SpaceXAI: Grok 4.6», все параметры лежат на карточке Grok 4.6.

На том же уровне STANDARD по соседству стоят gpt-5.6-terra (150 / 900), gemini-3.1-pro (250 / 1500) и claude-sonnet-5 (290 / 1450). По выходным токенам Grok 4.6 со своими 810 дешевле всех трёх, по входу — дешевле Sonnet 5 и Gemini 3.1 Pro. Как нейроны считаются от токенов, разобрано отдельно: нейроны и токены.

reasoning_effort: подстройте глубину размышления под задачу

Кроме баллов, у 4.6 появился параметр reasoning_effort — управление глубиной размышления. У Grok 4.5 его нет, и это единственное известное отличие в самом интерфейсе. Остальное совпадает: reasoning поддерживают обе, инструменты и строгие форматы ответа тоже. В каталоге у 4.6 на входе текст, изображения и файлы, на выходе только текст; официально xAI заявляет вход «текст и изображения». Знания — до 1 февраля 2026 года, всё, что случилось позже, придётся давать модели самим.

Промпт, на котором видно разницу в глубине

Задача: [опишите задачу в 2-3 предложениях].

Прежде чем отвечать, составь план из 3-5 шагов и назови, каких данных тебе не хватает. Затем выполни план. В конце отдельным блоком перечисли решения, в которых ты не уверен, и что должен проверить человек. Не додумывай факты, которых нет в моих вводных.

Меньше ходов на ту же задачу

Экономность — сильная сторона 4.6. По замерам задача решается в среднем за ~53 хода и ~0,5 млрд входных токенов, тогда как Claude Opus 5 тратит ~103 хода и ~2,0 млрд; замеренная стоимость задачи — 0,84 доллара. Сравнения по ходам между 4.6 и 4.5 не публиковали, так что читайте этот пункт как «Grok 4.6 против Opus 5», а не как прирост внутри линейки. Логика простая: нейроны считаются за токены, и модель, которой нужно меньше ходов, обходится дешевле при том же результате.

Где Grok 4.6 остаётся слабой

  • По индексу Artificial Analysis она третья: 61 — столько же, сколько у GPT-5.6 Sol Max, а выше стоят Claude Opus 5 (63) и Claude Fable 5.
  • Терминальные задачи — слабое место в абсолюте: 26% на Terminal-Bench v3.0. Рост к 4.5 почти вдвое, но на такой цифре рано доверять модели длинные автономные цепочки команд.
  • В DeepSWE v1.1 у неё 65,9% против 73% у GPT-5.6 Sol Max — на кодовых задачах этого бенчмарка Grok уступает.
  • В собственной таблице xAI из десяти строк больше всего первых мест берёт Claude Fable 5 Max, а не Grok.
  • Это доработка после обучения на прежней базовой модели: удлинённое дополнительное обучение, заново собранное SFT, обучение с подкреплением в агентных средах. Нового поколения ждать не стоит.
  • Открытых весов нет, self-hosting невозможен: только API xAI, Cursor и Grok Build — или наша платформа.

Тест на сильной стороне: документы и юридические формулировки

Ниже фрагмент договора и три вопроса к нему. Ответь по пунктам:
1) какие обязательства возникают у каждой стороны;
2) какие пункты противоречат друг другу;
3) что я как заказчик теряю при досрочном расторжении.

К каждому выводу дай ссылку на номер пункта. Если данных для вывода в тексте нет — напиши «в договоре не указано» вместо предположения.

[вставьте текст договора]

Почему 4.5 в каталоге теперь помечена как устаревшая

Grok 4.5 переехала в категорию LEGACY, а 4.6 стоит в FLAGSHIP. Это следствие цифр: при одинаковой цене, одинаковом контексте и том же уровне доступа новая версия выигрывает во всех замерах, где есть сравнение, — индекс, GDPval-AA v2, AA-Briefcase, DeepSWE v1.1, Terminal-Bench v3.0. Причина держать 4.5 остаётся одна: под неё уже отлажены промпты и трогать их не хочется.

Отдельный случай — Grok 4.20 beta: 200 / 400 нейронов и контекст 2 000 000 токенов, самый большой в каталоге, уровень доступа тоже STANDARD. Категория у неё LEGACY, но если нужно закинуть в модель очень много текста за один раз, среди Grok это единственный такой вариант.

Кому переключаться и как

  1. Документы, отчёты, аналитика, юридические тексты — переключайтесь: здесь у 4.6 самый крупный прирост Elo и первые места в таблице xAI.
  2. Код в редакторе с моделью — попробуйте, но сравните с альтернативами: CursorBench v3.2 у 4.6 — 69,9%, FrontierCode v1.1 Extended — 61,3%, а в DeepSWE v1.1 она уступает GPT-5.6 Sol Max (65,9% против 73%).
  3. Агенты с банковскими и финансовыми сценариями — стоит тестировать: в τ³-Banking у неё 50,7%, один из двух лучших результатов; APEX-Agents — 57,5%.
  4. Длинные автономные цепочки в терминале — оставайтесь на том, что у вас уже работает: 26% на Terminal-Bench v3.0 слишком мало, чтобы отпускать модель без присмотра.

Технически переключение — это просто выбор другой модели в списке перед отправкой сообщения: ни промпты, ни базы знаний переносить не нужно, предел контекста тот же 500 000 токенов. Пошагово это описано в материале о том, как пользоваться Grok 4.6.

Самый умный вариант на тарифе за 890 ₽

МодельИндекс AAНейронов вход/выходУровень доступа
Grok 4.661270 / 810STANDARD — с «Старта» за 890 ₽
GPT-5.6 Sol Max61, столько же800 / 4800MAX — нужен PRO за 4 990 ₽
Claude Opus 563650 / 3250MAX — нужен PRO за 4 990 ₽
Claude Fable 5выше 61, точной цифры нет2000 / 10000MAX — нужен PRO за 4 990 ₽
Grok 4.6 и модели с индексом не ниже

Отсюда главный практический вывод: Grok 4.6 — самый умный вариант, доступный на тарифе «Старт» за 890 ₽. Opus 5 обгоняет её на два пункта индекса, но стоит в 2,4 раза дороже по входу и в 4 раза по выходу и требует PRO за 4 990 ₽. GPT-5.6 Sol Max при том же индексе 61 стоит 800 / 4800 и тоже лежит на уровне MAX.

На бесплатном тарифе Grok 4.6 нет: там 52 модели из 96, 100 нейронов один раз при регистрации, 15 сообщений к платным моделям каждые 4 часа и без поиска в интернете. «Старт» открывает 81 модель, 300 нейронов, 50 сообщений каждые 4 часа, поиск в интернете и 30 минут проектов в сутки. Всего в каталоге 96 активных моделей, из них 29 флагманских; что брать под какие задачи — в разборе какой тариф выбрать.