Grok 4.6 вышла 12 августа 2026 и за месяц прибавила пять пунктов индекса Artificial Analysis — с 56 у Grok 4.5 до 61. Это третий результат: выше только Claude Opus 5 с 63 и Claude Fable 5, столько же 61 — у GPT-5.6 Sol Max. Базовая модель при этом та же, контекст тоже прежний (500 000 токенов), и цена в нашем каталоге не изменилась: 270 нейронов за миллион входных токенов и 810 за миллион выходных. Ниже — по задачам: где по замерам её обходит только Claude Opus 5, а где она откровенно проваливается.

Что изменилось после 4.5, а что осталось на месте

Формально это не новая большая модель, а доработка после обучения. xAI (в релизе и в нашем каталоге компания подписана ещё и как SpaceXAI — это одна и та же компания) удлинили дополнительное обучение, заново собрали SFT и провели обучение с подкреплением в агентных средах. База — от 4.5, поэтому всё, что вы знали из обзора Grok 4.5, остаётся в силе: изменились результаты на замерах и один параметр в интерфейсе. Для перспективы: у Grok 4.3 индекс Artificial Analysis на 23 пункта ниже, чем у 4.6.

ПараметрGrok 4.5Grok 4.6
Индекс Artificial Analysis5661
GDPval-AA v2, Elo15261753
AA-Briefcase, Elo13131577
Terminal-Bench v3.015,7%26%
Контекст, токенов500 000500 000
Цена, нейронов за 1М вход / выход270 / 810270 / 810
Параметр reasoning_effortнетесть
Уровень доступаSTANDARDSTANDARD
Категория в каталогеLEGACYFLAGSHIP
Grok 4.5 и Grok 4.6: что поменялось

Документы и право: здесь Grok 4.6 уступает только Opus 5

На GDPval-AA v2 Grok 4.6 набирает 1753 Elo против 1526 у 4.5. Впереди неё только Claude Opus 5 — больше никого. В собственной сравнительной таблице xAI из десяти строк больше всего первых мест забирает Claude Fable 5 Max, но работу со знаниями и юридические задачи Grok 4.6 берёт себе.

  • Разбор договора: где риски для вашей стороны, каких пунктов не хватает, какие формулировки читаются двояко.
  • Сведение нескольких регламентов или версий одного документа и поиск расхождений между ними.
  • Ответы по подшивке документов, целиком уложенной в контекст, — со ссылками на конкретные разделы.
  • Черновик официального письма, претензии или ответа на запрос с нужными оговорками.
  • Выжимка из большого отчёта с сохранением цифр и указанием, откуда каждая взята.

Промпт: разбор договора по рискам

Ты — юрист-аналитик. Ниже текст договора.

Сделай по порядку:
1. Выпиши пункты, которые создают риск для стороны «Заказчик», в порядке убывания риска.
2. Для каждого пункта дай: точную цитату, в чём риск, как переписать формулировку безопаснее.
3. Отдельно перечисли, чего в договоре нет, но обычно должно быть: ответственность за просрочку, порядок приёмки, права на результат, конфиденциальность, порядок расторжения.
4. Отдельно — формулировки, которые допускают два прочтения. Покажи оба.

Правила: не додумывай пункты, которых нет в тексте. Если для вывода не хватает данных, пиши «в тексте не указано». Ответ — таблицей: пункт | цитата | риск | как переписать.

Текст договора:
[вставьте текст]

Банковские сценарии: 50,7% и почему это ещё не «решено»

На τ³-Banking модель показывает 50,7% и входит в двойку лучших. На AA-Briefcase — 1577 Elo против 1313 у 4.5, прирост заметный. Но 50,7% — это ровно половина сценариев, и вторая половина остаётся за вами.

Grok 4.6 для программирования: что доверять, а что нет

Картина неровная, и цифры показывают это честнее любых слов. CursorBench v3.2 — 69,9%, FrontierCode v1.1 Extended — 61,3%, DeepSWE v1.1 — 65,9% с ростом на 11,9 пункта. На том же DeepSWE у GPT-5.6 Sol Max — 73%, то есть здесь Grok 4.6 уступает.

БенчмаркGrok 4.6Контекст цифры
DeepSWE v1.165,9%+11,9 пункта; у GPT-5.6 Sol Max — 73%
CursorBench v3.269,9%сравнение с 4.5 неизвестно
FrontierCode v1.1 Extended61,3%сравнение с 4.5 неизвестно
Terminal-Bench v2.1 (старая версия)88,4%версия старше и проще
Terminal-Bench v3.026%было 15,7% у 4.5
Код: результаты Grok 4.6

Практический вывод такой: точечные правки в существующем коде, ревью, разбор чужого модуля, функция по описанию — рабочая зона Grok 4.6. Длинные автономные сессии в терминале — нет, про это ниже. Если код у вас основная работа, сравните варианты в подборке нейросетей для кода: по этим замерам Grok 4.6 — крепкий универсал, а не лучший кодер каталога.

Промпт: ревью фрагмента кода

Ты — ревьюер. Ниже фрагмент кода и задача, которую он решает.

Сделай по порядку:
1. Найди ошибки, которые проявятся на реальных данных: пустые значения, гонки, повторные вызовы, необработанные ошибки. Для каждой укажи конкретный вход, на котором она сработает.
2. Отдельно — то, что не ошибка, а усложнение: дублирование, лишние слои, мёртвый код.
3. Предложи минимальный дифф: только изменённые строки, без переписывания файла целиком.

Правила: не меняй публичные сигнатуры и внешнее поведение. Если чего-то не видно из фрагмента (типы, вызывающий код, конфиг) — задай вопрос, а не предполагай.

Задача: [что должен делать код]
Код:
[вставьте код]

Агентные цепочки: 57,5% при вдвое меньшем числе ходов, чем у Opus 5

На APEX-Agents Grok 4.6 набирает 57,5%. Но интереснее другое: по опубликованным замерам задача решается в среднем за ~53 хода и ~0,5 млрд входных токенов, тогда как Claude Opus 5 тратит ~103 хода и ~2,0 млрд. Замеренная стоимость задачи — 0,84 доллара.

Токены расходуются на каждом ходу, поэтому вдвое меньше ходов — это прямая экономия, а не абстрактная «эффективность». Как складывается счёт, разобрано отдельно: как тратить меньше нейронов и нейроны и токены.

reasoning_effort: глубину размышления задаёте вы, а не модель

В каталоге Grok 4.6 поддерживает reasoning, вызов инструментов, строгие форматы ответа и параметр reasoning_effort — управление глубиной размышления. У Grok 4.5 этого параметра нет, и это заметное отличие в интерфейсе между двумя версиями. Смысл простой: вы решаете, думает модель коротко или долго, вместо того чтобы полагаться на её выбор.

  • Поднимать глубину стоит там, где ошибка дорога: юридический разбор, отладка чужого кода, план из нескольких зависимых этапов, длинная агентная цепочка.
  • Не стоит — на простом: переформулировать текст, вытащить поля из документа, ответить фактом из контекста, собрать текст по шаблону.
  • Помните про счёт: рассуждения приходят выходными токенами, а выход у Grok 4.6 ровно в три раза дороже входа — 810 нейронов за миллион против 270.

Текст, картинки и файлы на входе — только текст на выходе

Официально у Grok 4.6 на входе текст и изображения; в карточке нашего каталога на входе указаны текст, изображения и файлы. То есть скриншот интерфейса с ошибкой, фото страницы договора, график из отчёта или таблицу можно отдать модели напрямую.

Выход один — текст. Картинок, аудио и видео Grok 4.6 не создаёт, и планировать на неё такую работу не нужно.

Контекст 500 000 токенов: когда хватает, а когда мало

Контекст остался прежним — 500 000 токенов, роста относительно 4.5 не было. Для крупного договора, годового отчёта или репозитория среднего размера этого достаточно. Но у Gemini 3.7 Flash — 1 048 576, у моделей GPT-5.6 — 1 050 000, а у grok-4.20-beta вообще 2 000 000 (правда, это уже категория LEGACY).

Вторая граница — знания: они обрываются на 1 февраля 2026. Про всё, что позже, нужен поиск в интернете, а он появляется на тарифе «Старт»: на бесплатном тарифе поиска нет.

МодельНейронов за 1М вход / выходКонтекстУровень доступа
gemini-3.7-flash56 / 2811 048 576BASIC
gpt-5.6-terra150 / 9001 050 000STANDARD
gemini-3.1-pro250 / 15001 048 576STANDARD
Grok 4.6270 / 810500 000STANDARD
claude-sonnet-5290 / 14501 000 000STANDARD
qwen3.8-max300 / 9001 000 000BASIC
claude-opus-5650 / 32501 000 000MAX
gpt-5.6-sol800 / 48001 050 000MAX
claude-5-fable2000 / 100001 000 000MAX
Grok 4.6 среди соседей по каталогу

Обратная сторона той же таблицы: если задача простая, платить 270/810 незачем. Самая дешёвая модель каталога — qwen3.7-flash, 4 нейрона за входной миллион и 18 за выходной; рядом Gemini 3.7 Flash с 56/281 и контекстом 1 048 576, у обеих уровень доступа BASIC. Grok 4.6 берите там, где нужен балл 61, а не там, где хватит извлечения полей из документа.

Чего Grok 4.6 не умеет

  • Работать в терминале. Terminal-Bench v3.0 — 26%. Рост от 15,7% почти двукратный, но в абсолюте это провал: примерно три задачи из четырёх не доходят до конца. Цифра 88,4% относится к версии v2.1 — она старше и проще, не путайте их.
  • Быть лучшей моделью каталога. 61 по индексу Artificial Analysis — третий результат: у Claude Opus 5 — 63, у Claude Fable 5 выше, столько же 61 — у GPT-5.6 Sol Max.
  • Обгонять GPT-5.6 Sol Max на DeepSWE v1.1: 65,9% против 73%.
  • Забирать первые места в таблице самой xAI: из десяти строк больше всего их у Claude Fable 5 Max, а Grok 4.6 выигрывает в работе со знаниями и юридических задачах.
  • Выдавать что-либо кроме текста: генерации изображений, аудио и видео у неё нет.
  • Держать миллионный контекст: 500 000 против 1 048 576 у Gemini 3.7 Flash и 1 050 000 у моделей GPT-5.6.
  • Знать о событиях после 1 февраля 2026 без поиска в интернете.
  • Работать на вашем железе: открытых весов нет, доступ только через API xAI, Cursor и Grok Build — и через нашу платформу.

Как включить Grok 4.6 и сколько это стоит

Уровень доступа у модели STANDARD: она открывается на тарифе «Старт» за 890 ₽ и есть на всех тарифах выше. В списке моделей она подписана «SpaceXAI: Grok 4.6», идентификатор — x-ai/grok-4.6-20260810, категория FLAGSHIP (таких в каталоге 29 из 96 активных моделей). Все параметры — в карточке модели.

Цена в нейронах — 270 за входной миллион и 810 за выходной. Это ровно официальные 2 и 6 долларов xAI с наценкой платформы: цифры сходятся, нейрон стоит около 3 ₽. На бесплатном тарифе Grok 4.6 нет — там 52 модели из 96 и 100 нейронов один раз при регистрации.

ТарифЦенаНейроновМоделей из 96Grok 4.6
Бесплатный0 ₽100 один раз при регистрации52нет
Старт890 ₽30081есть
Стандартный2 690 ₽75081есть
PRO4 990 ₽1 65096есть
Ultra9 990 ₽3 35096есть
Тарифы и доступ к Grok 4.6

Разница не только в числе моделей. На бесплатном — 15 сообщений к платным моделям каждые 4 часа и без поиска в интернете; на «Старте» — 50 сообщений, поиск и 30 минут проектов в сутки; на «Стандартном» — 150 сообщений и 40 агентов; на PRO лимит сообщений снимается, агентов 60. Бесплатных моделей в каталоге две — они не тратят нейроны и в лимит сообщений не попадают.

Если выбираете план, есть отдельные разборы: какой тариф выбрать и тариф «Старт» за 890 ₽.

Арифметика, из-за которой Grok 4.6 стоит попробовать

Выше 61 по индексу Artificial Analysis поднимаются только Claude Opus 5 (63) и Claude Fable 5, и обе — уровень доступа MAX, то есть тариф PRO за 4 990 ₽. При этом Opus 5 дороже Grok 4.6 в 2,4 раза по входу и в 4 раза по выходу — за два пункта индекса.

Отсюда простой вывод: Grok 4.6 — самый умный вариант, который открывается на тарифе за 890 ₽. Подробное сравнение с флагманом — в Grok 4.6 против Claude Opus 5.

Что проверить на своих задачах сегодня

  1. Возьмите реальный договор или регламент и прогоните промпт про риски: это как раз та область, где по замерам Grok 4.6 уступает только Opus 5.
  2. Отдайте ей ревью одного своего модуля. DeepSWE 65,9% — уровень крепкого универсала, и на вашем коде это видно с первого прогона.
  3. Проведите одну длинную многошаговую задачу целиком на Grok 4.6 и сравните расход нейронов с прежним: ~53 хода против ~103 у Opus 5 экономят прежде всего на входных токенах.
  4. Поиграйте с reasoning_effort на одной и той же задаче: сначала низкая глубина, потом высокая. Сравните и качество, и расход выходных токенов.
  5. Не отдавайте ей автономную работу в терминале: 26% на Terminal-Bench v3.0 — примерно три провала из четырёх.

Пошаговый старт — где выбрать модель в чате, как передать файлы и задать глубину размышления — в руководстве как пользоваться Grok 4.6.