Grok 4.6 вышла 12 августа 2026 года, и первое, что стоит знать про сравнение с 4.5: доплачивать за обновление не придётся. В каталоге СуперИнтеллекта Grok 4.6 стоит те же 270 нейронов за миллион входных токенов и 810 за миллион выходных, что и 4.5. Контекст тоже прежний — 500 000 токенов. Вопрос, значит, не «дороже ли», а «лучше ли и в чём именно».
По качеству разрыв заметный. Индекс Artificial Analysis Intelligence у Grok 4.6 — 61 против 56 у 4.5, то есть пять пунктов за месяц. У Grok 4.3 индекс на 23 пункта ниже, чем у 4.6, так что за две версии линейка прошла большой путь — предыдущий шаг мы разбирали в обзоре Grok 4.5.
И сразу про потолок: 61 — не первое место. Столько же у GPT-5.6 Sol Max, выше стоят Claude Opus 5 с 63 и Claude Fable 5. По индексу Artificial Analysis Grok 4.6 третья, поэтому «лучшая модель на рынке» — это не про неё. Зато среди того, что открыто на тарифе за 890 ₽, она самая сильная; к этому вернёмся в конце.
Что именно выросло: замеры построчно
| Замер | Grok 4.5 | Grok 4.6 |
|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 61 |
| GDPval-AA v2, Elo | 1526 | 1753 |
| AA-Briefcase, Elo | 1313 | 1577 |
| DeepSWE v1.1 | на 11,9 пункта ниже | 65,9% |
| Terminal-Bench v3.0 | 15,7% | 26% |
Крупнее всего прирост в двух Elo-замерах: GDPval-AA v2 — 1753 против 1526, AA-Briefcase — 1577 против 1313. По GDPval-AA v2 впереди Grok 4.6 остаётся только Claude Opus 5. В собственной таблице xAI из десяти строк Grok 4.6 берёт первые места в работе со знаниями и в юридических задачах — если это ваш профиль, прирост вы увидите в первую очередь здесь.
С терминалом сложнее, и здесь легко запутаться в версиях бенчмарка. На Terminal-Bench v3.0 у 4.6 — 26%, у 4.5 — 15,7%, почти вдвое лучше. На более старой и простой v2.1 та же модель даёт 88,4%. Цифры между версиями несопоставимы: если вам показывают «88%», уточняйте версию, ориентироваться стоит на свежую.
Цена, контекст и доступ: здесь не изменилось ничего
| Параметр | Grok 4.5 | Grok 4.6 |
|---|---|---|
| Нейронов за 1 млн входных токенов | 270 | 270 |
| Нейронов за 1 млн выходных токенов | 810 | 810 |
| Контекст | 500 000 токенов | 500 000 токенов |
| Уровень доступа | STANDARD | STANDARD |
| Категория в каталоге | LEGACY (устаревшая) | FLAGSHIP |
| Параметр reasoning_effort | нет | есть |
Цена в нейронах — это официальные 2 и 6 долларов за миллион токенов у xAI с нашей наценкой, цифры сходятся. Уровень доступа у обеих версий STANDARD, то есть обе открыты с тарифа «Старт» за 890 ₽. Идентификатор новой версии — x-ai/grok-4.6-20260810, в списке она подписана «SpaceXAI: Grok 4.6», все параметры лежат на карточке Grok 4.6.
На том же уровне STANDARD по соседству стоят gpt-5.6-terra (150 / 900), gemini-3.1-pro (250 / 1500) и claude-sonnet-5 (290 / 1450). По выходным токенам Grok 4.6 со своими 810 дешевле всех трёх, по входу — дешевле Sonnet 5 и Gemini 3.1 Pro. Как нейроны считаются от токенов, разобрано отдельно: нейроны и токены.
reasoning_effort: подстройте глубину размышления под задачу
Кроме баллов, у 4.6 появился параметр reasoning_effort — управление глубиной размышления. У Grok 4.5 его нет, и это единственное известное отличие в самом интерфейсе. Остальное совпадает: reasoning поддерживают обе, инструменты и строгие форматы ответа тоже. В каталоге у 4.6 на входе текст, изображения и файлы, на выходе только текст; официально xAI заявляет вход «текст и изображения». Знания — до 1 февраля 2026 года, всё, что случилось позже, придётся давать модели самим.
Промпт, на котором видно разницу в глубине
Задача: [опишите задачу в 2-3 предложениях].
Прежде чем отвечать, составь план из 3-5 шагов и назови, каких данных тебе не хватает. Затем выполни план. В конце отдельным блоком перечисли решения, в которых ты не уверен, и что должен проверить человек. Не додумывай факты, которых нет в моих вводных.Меньше ходов на ту же задачу
Экономность — сильная сторона 4.6. По замерам задача решается в среднем за ~53 хода и ~0,5 млрд входных токенов, тогда как Claude Opus 5 тратит ~103 хода и ~2,0 млрд; замеренная стоимость задачи — 0,84 доллара. Сравнения по ходам между 4.6 и 4.5 не публиковали, так что читайте этот пункт как «Grok 4.6 против Opus 5», а не как прирост внутри линейки. Логика простая: нейроны считаются за токены, и модель, которой нужно меньше ходов, обходится дешевле при том же результате.
Где Grok 4.6 остаётся слабой
- По индексу Artificial Analysis она третья: 61 — столько же, сколько у GPT-5.6 Sol Max, а выше стоят Claude Opus 5 (63) и Claude Fable 5.
- Терминальные задачи — слабое место в абсолюте: 26% на Terminal-Bench v3.0. Рост к 4.5 почти вдвое, но на такой цифре рано доверять модели длинные автономные цепочки команд.
- В DeepSWE v1.1 у неё 65,9% против 73% у GPT-5.6 Sol Max — на кодовых задачах этого бенчмарка Grok уступает.
- В собственной таблице xAI из десяти строк больше всего первых мест берёт Claude Fable 5 Max, а не Grok.
- Это доработка после обучения на прежней базовой модели: удлинённое дополнительное обучение, заново собранное SFT, обучение с подкреплением в агентных средах. Нового поколения ждать не стоит.
- Открытых весов нет, self-hosting невозможен: только API xAI, Cursor и Grok Build — или наша платформа.
Тест на сильной стороне: документы и юридические формулировки
Ниже фрагмент договора и три вопроса к нему. Ответь по пунктам:
1) какие обязательства возникают у каждой стороны;
2) какие пункты противоречат друг другу;
3) что я как заказчик теряю при досрочном расторжении.
К каждому выводу дай ссылку на номер пункта. Если данных для вывода в тексте нет — напиши «в договоре не указано» вместо предположения.
[вставьте текст договора]Почему 4.5 в каталоге теперь помечена как устаревшая
Grok 4.5 переехала в категорию LEGACY, а 4.6 стоит в FLAGSHIP. Это следствие цифр: при одинаковой цене, одинаковом контексте и том же уровне доступа новая версия выигрывает во всех замерах, где есть сравнение, — индекс, GDPval-AA v2, AA-Briefcase, DeepSWE v1.1, Terminal-Bench v3.0. Причина держать 4.5 остаётся одна: под неё уже отлажены промпты и трогать их не хочется.
Отдельный случай — Grok 4.20 beta: 200 / 400 нейронов и контекст 2 000 000 токенов, самый большой в каталоге, уровень доступа тоже STANDARD. Категория у неё LEGACY, но если нужно закинуть в модель очень много текста за один раз, среди Grok это единственный такой вариант.
Кому переключаться и как
- Документы, отчёты, аналитика, юридические тексты — переключайтесь: здесь у 4.6 самый крупный прирост Elo и первые места в таблице xAI.
- Код в редакторе с моделью — попробуйте, но сравните с альтернативами: CursorBench v3.2 у 4.6 — 69,9%, FrontierCode v1.1 Extended — 61,3%, а в DeepSWE v1.1 она уступает GPT-5.6 Sol Max (65,9% против 73%).
- Агенты с банковскими и финансовыми сценариями — стоит тестировать: в τ³-Banking у неё 50,7%, один из двух лучших результатов; APEX-Agents — 57,5%.
- Длинные автономные цепочки в терминале — оставайтесь на том, что у вас уже работает: 26% на Terminal-Bench v3.0 слишком мало, чтобы отпускать модель без присмотра.
Технически переключение — это просто выбор другой модели в списке перед отправкой сообщения: ни промпты, ни базы знаний переносить не нужно, предел контекста тот же 500 000 токенов. Пошагово это описано в материале о том, как пользоваться Grok 4.6.
Самый умный вариант на тарифе за 890 ₽
| Модель | Индекс AA | Нейронов вход/выход | Уровень доступа |
|---|---|---|---|
| Grok 4.6 | 61 | 270 / 810 | STANDARD — с «Старта» за 890 ₽ |
| GPT-5.6 Sol Max | 61, столько же | 800 / 4800 | MAX — нужен PRO за 4 990 ₽ |
| Claude Opus 5 | 63 | 650 / 3250 | MAX — нужен PRO за 4 990 ₽ |
| Claude Fable 5 | выше 61, точной цифры нет | 2000 / 10000 | MAX — нужен PRO за 4 990 ₽ |
Отсюда главный практический вывод: Grok 4.6 — самый умный вариант, доступный на тарифе «Старт» за 890 ₽. Opus 5 обгоняет её на два пункта индекса, но стоит в 2,4 раза дороже по входу и в 4 раза по выходу и требует PRO за 4 990 ₽. GPT-5.6 Sol Max при том же индексе 61 стоит 800 / 4800 и тоже лежит на уровне MAX.
На бесплатном тарифе Grok 4.6 нет: там 52 модели из 96, 100 нейронов один раз при регистрации, 15 сообщений к платным моделям каждые 4 часа и без поиска в интернете. «Старт» открывает 81 модель, 300 нейронов, 50 сообщений каждые 4 часа, поиск в интернете и 30 минут проектов в сутки. Всего в каталоге 96 активных моделей, из них 29 флагманских; что брать под какие задачи — в разборе какой тариф выбрать.


