Grok 4.6 вышла 12 августа 2026 и за месяц прибавила пять пунктов индекса Artificial Analysis — с 56 у Grok 4.5 до 61. Это третий результат: выше только Claude Opus 5 с 63 и Claude Fable 5, столько же 61 — у GPT-5.6 Sol Max. Базовая модель при этом та же, контекст тоже прежний (500 000 токенов), и цена в нашем каталоге не изменилась: 270 нейронов за миллион входных токенов и 810 за миллион выходных. Ниже — по задачам: где по замерам её обходит только Claude Opus 5, а где она откровенно проваливается.
Что изменилось после 4.5, а что осталось на месте
Формально это не новая большая модель, а доработка после обучения. xAI (в релизе и в нашем каталоге компания подписана ещё и как SpaceXAI — это одна и та же компания) удлинили дополнительное обучение, заново собрали SFT и провели обучение с подкреплением в агентных средах. База — от 4.5, поэтому всё, что вы знали из обзора Grok 4.5, остаётся в силе: изменились результаты на замерах и один параметр в интерфейсе. Для перспективы: у Grok 4.3 индекс Artificial Analysis на 23 пункта ниже, чем у 4.6.
| Параметр | Grok 4.5 | Grok 4.6 |
|---|---|---|
| Индекс Artificial Analysis | 56 | 61 |
| GDPval-AA v2, Elo | 1526 | 1753 |
| AA-Briefcase, Elo | 1313 | 1577 |
| Terminal-Bench v3.0 | 15,7% | 26% |
| Контекст, токенов | 500 000 | 500 000 |
| Цена, нейронов за 1М вход / выход | 270 / 810 | 270 / 810 |
| Параметр reasoning_effort | нет | есть |
| Уровень доступа | STANDARD | STANDARD |
| Категория в каталоге | LEGACY | FLAGSHIP |
Документы и право: здесь Grok 4.6 уступает только Opus 5
На GDPval-AA v2 Grok 4.6 набирает 1753 Elo против 1526 у 4.5. Впереди неё только Claude Opus 5 — больше никого. В собственной сравнительной таблице xAI из десяти строк больше всего первых мест забирает Claude Fable 5 Max, но работу со знаниями и юридические задачи Grok 4.6 берёт себе.
- Разбор договора: где риски для вашей стороны, каких пунктов не хватает, какие формулировки читаются двояко.
- Сведение нескольких регламентов или версий одного документа и поиск расхождений между ними.
- Ответы по подшивке документов, целиком уложенной в контекст, — со ссылками на конкретные разделы.
- Черновик официального письма, претензии или ответа на запрос с нужными оговорками.
- Выжимка из большого отчёта с сохранением цифр и указанием, откуда каждая взята.
Промпт: разбор договора по рискам
Ты — юрист-аналитик. Ниже текст договора.
Сделай по порядку:
1. Выпиши пункты, которые создают риск для стороны «Заказчик», в порядке убывания риска.
2. Для каждого пункта дай: точную цитату, в чём риск, как переписать формулировку безопаснее.
3. Отдельно перечисли, чего в договоре нет, но обычно должно быть: ответственность за просрочку, порядок приёмки, права на результат, конфиденциальность, порядок расторжения.
4. Отдельно — формулировки, которые допускают два прочтения. Покажи оба.
Правила: не додумывай пункты, которых нет в тексте. Если для вывода не хватает данных, пиши «в тексте не указано». Ответ — таблицей: пункт | цитата | риск | как переписать.
Текст договора:
[вставьте текст]Банковские сценарии: 50,7% и почему это ещё не «решено»
На τ³-Banking модель показывает 50,7% и входит в двойку лучших. На AA-Briefcase — 1577 Elo против 1313 у 4.5, прирост заметный. Но 50,7% — это ровно половина сценариев, и вторая половина остаётся за вами.
Grok 4.6 для программирования: что доверять, а что нет
Картина неровная, и цифры показывают это честнее любых слов. CursorBench v3.2 — 69,9%, FrontierCode v1.1 Extended — 61,3%, DeepSWE v1.1 — 65,9% с ростом на 11,9 пункта. На том же DeepSWE у GPT-5.6 Sol Max — 73%, то есть здесь Grok 4.6 уступает.
| Бенчмарк | Grok 4.6 | Контекст цифры |
|---|---|---|
| DeepSWE v1.1 | 65,9% | +11,9 пункта; у GPT-5.6 Sol Max — 73% |
| CursorBench v3.2 | 69,9% | сравнение с 4.5 неизвестно |
| FrontierCode v1.1 Extended | 61,3% | сравнение с 4.5 неизвестно |
| Terminal-Bench v2.1 (старая версия) | 88,4% | версия старше и проще |
| Terminal-Bench v3.0 | 26% | было 15,7% у 4.5 |
Практический вывод такой: точечные правки в существующем коде, ревью, разбор чужого модуля, функция по описанию — рабочая зона Grok 4.6. Длинные автономные сессии в терминале — нет, про это ниже. Если код у вас основная работа, сравните варианты в подборке нейросетей для кода: по этим замерам Grok 4.6 — крепкий универсал, а не лучший кодер каталога.
Промпт: ревью фрагмента кода
Ты — ревьюер. Ниже фрагмент кода и задача, которую он решает.
Сделай по порядку:
1. Найди ошибки, которые проявятся на реальных данных: пустые значения, гонки, повторные вызовы, необработанные ошибки. Для каждой укажи конкретный вход, на котором она сработает.
2. Отдельно — то, что не ошибка, а усложнение: дублирование, лишние слои, мёртвый код.
3. Предложи минимальный дифф: только изменённые строки, без переписывания файла целиком.
Правила: не меняй публичные сигнатуры и внешнее поведение. Если чего-то не видно из фрагмента (типы, вызывающий код, конфиг) — задай вопрос, а не предполагай.
Задача: [что должен делать код]
Код:
[вставьте код]Агентные цепочки: 57,5% при вдвое меньшем числе ходов, чем у Opus 5
На APEX-Agents Grok 4.6 набирает 57,5%. Но интереснее другое: по опубликованным замерам задача решается в среднем за ~53 хода и ~0,5 млрд входных токенов, тогда как Claude Opus 5 тратит ~103 хода и ~2,0 млрд. Замеренная стоимость задачи — 0,84 доллара.
Токены расходуются на каждом ходу, поэтому вдвое меньше ходов — это прямая экономия, а не абстрактная «эффективность». Как складывается счёт, разобрано отдельно: как тратить меньше нейронов и нейроны и токены.
reasoning_effort: глубину размышления задаёте вы, а не модель
В каталоге Grok 4.6 поддерживает reasoning, вызов инструментов, строгие форматы ответа и параметр reasoning_effort — управление глубиной размышления. У Grok 4.5 этого параметра нет, и это заметное отличие в интерфейсе между двумя версиями. Смысл простой: вы решаете, думает модель коротко или долго, вместо того чтобы полагаться на её выбор.
- Поднимать глубину стоит там, где ошибка дорога: юридический разбор, отладка чужого кода, план из нескольких зависимых этапов, длинная агентная цепочка.
- Не стоит — на простом: переформулировать текст, вытащить поля из документа, ответить фактом из контекста, собрать текст по шаблону.
- Помните про счёт: рассуждения приходят выходными токенами, а выход у Grok 4.6 ровно в три раза дороже входа — 810 нейронов за миллион против 270.
Текст, картинки и файлы на входе — только текст на выходе
Официально у Grok 4.6 на входе текст и изображения; в карточке нашего каталога на входе указаны текст, изображения и файлы. То есть скриншот интерфейса с ошибкой, фото страницы договора, график из отчёта или таблицу можно отдать модели напрямую.
Выход один — текст. Картинок, аудио и видео Grok 4.6 не создаёт, и планировать на неё такую работу не нужно.
Контекст 500 000 токенов: когда хватает, а когда мало
Контекст остался прежним — 500 000 токенов, роста относительно 4.5 не было. Для крупного договора, годового отчёта или репозитория среднего размера этого достаточно. Но у Gemini 3.7 Flash — 1 048 576, у моделей GPT-5.6 — 1 050 000, а у grok-4.20-beta вообще 2 000 000 (правда, это уже категория LEGACY).
Вторая граница — знания: они обрываются на 1 февраля 2026. Про всё, что позже, нужен поиск в интернете, а он появляется на тарифе «Старт»: на бесплатном тарифе поиска нет.
| Модель | Нейронов за 1М вход / выход | Контекст | Уровень доступа |
|---|---|---|---|
| gemini-3.7-flash | 56 / 281 | 1 048 576 | BASIC |
| gpt-5.6-terra | 150 / 900 | 1 050 000 | STANDARD |
| gemini-3.1-pro | 250 / 1500 | 1 048 576 | STANDARD |
| Grok 4.6 | 270 / 810 | 500 000 | STANDARD |
| claude-sonnet-5 | 290 / 1450 | 1 000 000 | STANDARD |
| qwen3.8-max | 300 / 900 | 1 000 000 | BASIC |
| claude-opus-5 | 650 / 3250 | 1 000 000 | MAX |
| gpt-5.6-sol | 800 / 4800 | 1 050 000 | MAX |
| claude-5-fable | 2000 / 10000 | 1 000 000 | MAX |
Обратная сторона той же таблицы: если задача простая, платить 270/810 незачем. Самая дешёвая модель каталога — qwen3.7-flash, 4 нейрона за входной миллион и 18 за выходной; рядом Gemini 3.7 Flash с 56/281 и контекстом 1 048 576, у обеих уровень доступа BASIC. Grok 4.6 берите там, где нужен балл 61, а не там, где хватит извлечения полей из документа.
Чего Grok 4.6 не умеет
- Работать в терминале. Terminal-Bench v3.0 — 26%. Рост от 15,7% почти двукратный, но в абсолюте это провал: примерно три задачи из четырёх не доходят до конца. Цифра 88,4% относится к версии v2.1 — она старше и проще, не путайте их.
- Быть лучшей моделью каталога. 61 по индексу Artificial Analysis — третий результат: у Claude Opus 5 — 63, у Claude Fable 5 выше, столько же 61 — у GPT-5.6 Sol Max.
- Обгонять GPT-5.6 Sol Max на DeepSWE v1.1: 65,9% против 73%.
- Забирать первые места в таблице самой xAI: из десяти строк больше всего их у Claude Fable 5 Max, а Grok 4.6 выигрывает в работе со знаниями и юридических задачах.
- Выдавать что-либо кроме текста: генерации изображений, аудио и видео у неё нет.
- Держать миллионный контекст: 500 000 против 1 048 576 у Gemini 3.7 Flash и 1 050 000 у моделей GPT-5.6.
- Знать о событиях после 1 февраля 2026 без поиска в интернете.
- Работать на вашем железе: открытых весов нет, доступ только через API xAI, Cursor и Grok Build — и через нашу платформу.
Как включить Grok 4.6 и сколько это стоит
Уровень доступа у модели STANDARD: она открывается на тарифе «Старт» за 890 ₽ и есть на всех тарифах выше. В списке моделей она подписана «SpaceXAI: Grok 4.6», идентификатор — x-ai/grok-4.6-20260810, категория FLAGSHIP (таких в каталоге 29 из 96 активных моделей). Все параметры — в карточке модели.
Цена в нейронах — 270 за входной миллион и 810 за выходной. Это ровно официальные 2 и 6 долларов xAI с наценкой платформы: цифры сходятся, нейрон стоит около 3 ₽. На бесплатном тарифе Grok 4.6 нет — там 52 модели из 96 и 100 нейронов один раз при регистрации.
| Тариф | Цена | Нейронов | Моделей из 96 | Grok 4.6 |
|---|---|---|---|---|
| Бесплатный | 0 ₽ | 100 один раз при регистрации | 52 | нет |
| Старт | 890 ₽ | 300 | 81 | есть |
| Стандартный | 2 690 ₽ | 750 | 81 | есть |
| PRO | 4 990 ₽ | 1 650 | 96 | есть |
| Ultra | 9 990 ₽ | 3 350 | 96 | есть |
Разница не только в числе моделей. На бесплатном — 15 сообщений к платным моделям каждые 4 часа и без поиска в интернете; на «Старте» — 50 сообщений, поиск и 30 минут проектов в сутки; на «Стандартном» — 150 сообщений и 40 агентов; на PRO лимит сообщений снимается, агентов 60. Бесплатных моделей в каталоге две — они не тратят нейроны и в лимит сообщений не попадают.
Если выбираете план, есть отдельные разборы: какой тариф выбрать и тариф «Старт» за 890 ₽.
Арифметика, из-за которой Grok 4.6 стоит попробовать
Выше 61 по индексу Artificial Analysis поднимаются только Claude Opus 5 (63) и Claude Fable 5, и обе — уровень доступа MAX, то есть тариф PRO за 4 990 ₽. При этом Opus 5 дороже Grok 4.6 в 2,4 раза по входу и в 4 раза по выходу — за два пункта индекса.
Отсюда простой вывод: Grok 4.6 — самый умный вариант, который открывается на тарифе за 890 ₽. Подробное сравнение с флагманом — в Grok 4.6 против Claude Opus 5.
Что проверить на своих задачах сегодня
- Возьмите реальный договор или регламент и прогоните промпт про риски: это как раз та область, где по замерам Grok 4.6 уступает только Opus 5.
- Отдайте ей ревью одного своего модуля. DeepSWE 65,9% — уровень крепкого универсала, и на вашем коде это видно с первого прогона.
- Проведите одну длинную многошаговую задачу целиком на Grok 4.6 и сравните расход нейронов с прежним: ~53 хода против ~103 у Opus 5 экономят прежде всего на входных токенах.
- Поиграйте с reasoning_effort на одной и той же задаче: сначала низкая глубина, потом высокая. Сравните и качество, и расход выходных токенов.
- Не отдавайте ей автономную работу в терминале: 26% на Terminal-Bench v3.0 — примерно три провала из четырёх.
Пошаговый старт — где выбрать модель в чате, как передать файлы и задать глубину размышления — в руководстве как пользоваться Grok 4.6.



