Grok 4.6 вышла 12 августа 2026 года, и первое, что стоит знать: базовая модель осталась той же, что у Grok 4.5. Заново её не учили — сделали удлинённое дополнительное обучение: заново собранное SFT и обучение с подкреплением в агентных средах. Прибавка при этом измеримая: индекс Artificial Analysis вырос с 56 до 61 за месяц, а цена в нейронах не изменилась.

Дальше по порядку: что именно выросло в цифрах, что не тронули совсем, где Grok 4.6 проигрывает конкурентам и почему её главный аргумент — не баллы, а расход токенов на одну задачу.

Доработка после обучения — деталь, которая меняет ожидания

Когда модель получает новый номер, обычно ждут новую базу: другой размер, другой корпус обучения, другую архитектуру. Здесь этого нет. Grok 4.6 стоит на том же фундаменте, что модель из обзора Grok 4.5, и отличается более длинным этапом дообучения, часть которого прошла в агентных средах — модель училась не отвечать одной репликой, а доводить задачу до конца через инструменты.

Вывод для практики простой: принципиально новых умений ждать не стоит, прежние стали аккуратнее. Основной прирост в замерах пришёлся на агентные и профессиональные задачи. Сравнение версия к версии — в отдельном материале, чем 4.6 отличается от 4.5; полный список возможностей — в что умеет Grok 4.6.

И приятная арифметика: в нашем каталоге Grok 4.5 стоит те же 270 нейронов за 1 млн входных токенов и 810 за 1 млн выходных, что и 4.6, и открыта с того же уровня доступа. Разница только в категории: 4.5 переведена в LEGACY, 4.6 идёт как FLAGSHIP. Переезд с 4.5 на 4.6 не стоит ничего — меняете модель в настройках агента, ценник остаётся тем же.

Что выросло: цифры по бенчмаркам

Ниже опубликованные замеры. Там, где известен результат Grok 4.5, он стоит рядом — иначе прирост не прочитать.

БенчмаркGrok 4.6Grok 4.5Изменение и контекст
Artificial Analysis Intelligence Index6156+5 за месяц; столько же у GPT-5.6 Sol Max, у Claude Opus 5 Max — 63, у Claude Fable 5 — выше
GDPval-AA v21753 Elo1526 Elo+227; впереди только Claude Opus 5
AA-Briefcase1577 Elo1313 Elo+264
DeepSWE v1.165,9%+11,9 пункта; у GPT-5.6 Sol Max — 73%
Terminal-Bench v3.026%15,7%почти вдвое лучше, но в абсолюте слабо
Terminal-Bench v2.188,4%версия старее и проще, сравнивать с v3.0 нельзя
CursorBench v3.269,9%
FrontierCode v1.1 Extended61,3%
APEX-Agents57,5%
τ³-Banking50,7%входит в двойку лучших результатов
Контекст500 000 токенов500 000 токеновбез изменений

Сильнее всего выросли GDPval-AA v2 и AA-Briefcase: плюс 227 и плюс 264 Elo. По GDPval-AA v2 впереди Grok 4.6 осталась только Claude Opus 5 — а Opus доступен лишь на уровне MAX, тогда как Grok 4.6 открыта с уровня STANDARD.

Для масштаба линейки: у Grok 4.3 индекс Artificial Analysis на 23 пункта меньше, и она до сих пор в каталоге, только в категории LEGACY. Последние пять пунктов Grok получила без новой базы — одним дообучением.

Ещё одно отличие видно прямо в интерфейсе: у Grok 4.6 есть параметр reasoning_effort — управление глубиной размышления. У 4.5 его нет. На простых запросах это прямая экономия: модель не разворачивает длинную цепочку рассуждений там, где хватает короткого ответа.

Что не изменилось: контекст, цена и форматы

Контекст — те же 500 000 токенов, ровно как у 4.5. Знания — до 1 февраля 2026 года. Вход: текст и изображения, на нашей платформе к ним добавляются файлы. Выход только текстовый: ни картинок, ни звука. Открытых весов нет, поднять у себя не получится — доступ идёт через API xAI, Cursor, Grok Build и платформы вроде нашей.

Официальные цены xAI тоже прежние: 2 доллара за 1 млн входных токенов и 6 за 1 млн выходных. Подорожал только кэшированный вход — с 0,3 до 0,5 доллара. То есть за пять пунктов индекса платить больше не пришлось. Как доллары за токены превращаются в списанные нейроны, разобрано в материале про нейроны и токены.

Слабые места: что придётся признать

Grok 4.6 — не лучшая модель на рынке, и подавать её так было бы нечестно. По индексу Artificial Analysis она третья: 61 против 63 у Claude Opus 5 Max, а у Claude Fable 5 индекс ещё выше. С GPT-5.6 Sol Max — ничья, 61 на 61.

Терминальные задачи — прямая слабость. 26% на Terminal-Bench v3.0: против 15,7% у 4.5 это почти вдвое лучше, но в абсолюте цифра плохая — примерно три задачи из четырёх до конца не доходят. И не путайте это с 88,4% на Terminal-Bench v2.1: версия старее и проще, высокий балл там ничего не говорит про v3.0.

В коде она тоже не первая: 65,9% на DeepSWE v1.1 против 73% у GPT-5.6 Sol Max. Семь пунктов на инженерных задачах — это реальная разница в количестве правок руками. Если код у вас основной сценарий, сравните варианты в подборке нейросетей для кода, прежде чем переезжать.

Показательно и то, что в собственной сравнительной таблице xAI из десяти строк больше всего первых мест берёт не Grok, а Claude Fable 5 Max. Grok 4.6 выигрывает в работе со знаниями и в юридических задачах — там она действительно сильнее. Универсальным лидером её xAI не продаёт, и это располагает.

Эффективность: главный аргумент, и он про деньги

Вот где Grok 4.6 действительно выделяется. На замерах агентных задач она доходит до результата в среднем за ~53 хода и ~0,5 млрд входных токенов. Claude Opus 5 на тех же задачах тратит ~103 хода и ~2,0 млрд входных токенов: почти вдвое больше шагов и вчетверо больше прочитанного контекста — при разнице в индексе всего в два пункта.

В деньгах это выглядит так: замеренная стоимость решения задачи — 0,84 доллара. Не цена за миллион токенов, а цена за доведённую до конца задачу. Именно этот показатель важен, когда модель работает в цикле с инструментами, а не отвечает одной репликой в чате.

Разница между дешёвым тарифом и дешёвой работой здесь ключевая: модель с низким ценником, которая ходит по кругу сто с лишним шагов, обойдётся дороже более дорогой, но собранной. Приёмы, которые сокращают списания, собраны в материале про экономию нейронов.

Сколько Grok 4.6 стоит на платформе

В каталоге модель подписана как «SpaceXAI: Grok 4.6», идентификатор x-ai/grok-4.6-20260810, категория FLAGSHIP. Цена — 270 нейронов за 1 млн входных токенов и 810 за 1 млн выходных: это ровно официальные 2 и 6 долларов с нашей наценкой, цифры сходятся. Уровень доступа STANDARD. Поддерживаются reasoning, reasoning_effort, вызов инструментов и строгие форматы ответа.

МодельВход, нейронов/1МВыход, нейронов/1МКонтекстДоступ
qwen3.7-flash418BASIC
gpt-5.6-luna14871 050 000BASIC
gpt-5.6-luna-pro14871 050 000STANDARD
gemini-3.7-flash562811 048 576BASIC
gpt-5.6-terra1509001 050 000STANDARD
gemini-3.1-pro2501 5001 048 576STANDARD
Grok 4.6270810500 000STANDARD
claude-sonnet-52901 4501 000 000STANDARD
qwen3.8-max3009001 000 000BASIC
kimi-k36003 0001 048 576STANDARD
claude-opus-56503 2501 000 000MAX
gpt-5.6-sol8004 8001 050 000MAX
claude-5-fable2 00010 0001 000 000MAX

Отсюда главный вывод, и он проверяем. Grok 4.6 набирает 61 по индексу Artificial Analysis при цене 270/810. Обе модели с индексом выше — Claude Opus 5 (63) и Claude Fable 5 — имеют уровень доступа MAX, то есть требуют тарифа PRO за 4 990 ₽. При этом Opus 5 дороже Grok 4.6 в 2,4 раза по входу и в 4 раза по выходу — за два пункта индекса. Grok 4.6 — самый умный вариант, доступный на тарифе за 890 ₽.

Grok 4.6 против остальной линейки Grok

МодельВход, нейронов/1МВыход, нейронов/1МКонтекстКатегория
Grok 4.6270810500 000FLAGSHIP
grok-4.5270810500 000LEGACY
grok-4.31633251 000 000LEGACY
grok-4.20-beta2004002 000 000LEGACY

Все четыре открыты с уровня STANDARD, то есть со «Старта». Компромиссы видны сразу: grok-4.20-beta даёт 2 000 000 токенов контекста за 200/400, grok-4.3 — 1 000 000 за 163/325, но индекс у 4.3 на 23 пункта ниже, чем у 4.6, и все три предыдущие версии сидят в LEGACY. Брать их стоит осознанно — ради контекста или ценника, а не ради качества ответа.

Кому подойдёт Grok 4.6

  • Работа со знаниями и документами: GDPval-AA v2 — 1753 Elo, AA-Briefcase — 1577 Elo, и по первому впереди только Claude Opus 5.
  • Юридические задачи: одна из двух областей, где Grok 4.6 берёт первые места в собственной таблице xAI.
  • Финансовые и клиентские сценарии с инструментами: 50,7% на τ³-Banking — в числе двух лучших результатов.
  • Агентные цепочки, где важна цена доведённой до конца задачи: ~53 хода вместо ~103 и 0,84 доллара за задачу.
  • Те, кому нужен максимум качества без перехода на PRO: на «Старте» за 890 ₽ модели с более высоким индексом нет.

Кому стоит взять другое

  • Автономные терминальные агенты: 26% на Terminal-Bench v3.0 — слишком мало, чтобы оставлять модель без присмотра.
  • Тяжёлая инженерия кода: 65,9% на DeepSWE v1.1 против 73% у GPT-5.6 Sol Max.
  • Документы и репозитории, которые не влезают в 500 000 токенов: у Claude и линейки GPT-5.6 контекст около миллиона и выше.
  • Задачи, где нужен абсолютный максимум качества, а бюджет не главное: впереди Claude Opus 5 (63) и Claude Fable 5, обе на уровне MAX.
  • Совсем простые запросы: платить 270/810 за них незачем — в каталоге есть gpt-5.6-luna за 14/87 и qwen3.7-flash за 4/18.

Как проверить самому за один вечер

Не верьте таблицам на слово — проверьте на своём материале, и лучше там, где Grok 4.6 заявлена сильной: знания и юридический разбор. Возьмите настоящий документ, а не учебный пример, и смотрите на одну вещь — признаёт ли модель нехватку данных вместо того, чтобы додумывать. Промпт ниже можно скопировать как есть.

Проверка на работе со знаниями и юридическом разборе

Ты юрист по договорному праву РФ. Ниже текст договора оказания услуг.

Сделай три вещи:
1. Найди условия, которые ухудшают позицию заказчика по сравнению с диспозитивными нормами ГК РФ. Для каждого укажи номер пункта договора и конкретную норму.
2. Отдельно перечисли условия, которые с высокой вероятностью суд признает несогласованными или ничтожными, и объясни почему одним предложением.
3. Для каждой находки предложи формулировку-замену — один абзац, готовый к вставке.

Правила: не пересказывай договор своими словами. Если для вывода не хватает данных (нет приложений, не указана цена, не ясен предмет) — прямо напиши, чего не хватает, и не достраивай факты сам.

Текст договора:
[вставьте текст]

Затем прогоните тот же промпт на grok-4.5: ценник у неё тот же, 270/810, поэтому второй прогон стоит ровно столько же, сколько первый. Это самый честный способ понять, значат ли пять пунктов индекса что-то на ваших задачах — и стоит ли вообще менять модель в рабочих агентах.

Где попробовать и с какого тарифа

Grok 4.6 открыта с уровня STANDARD, то есть с тарифа «Старт» за 890 ₽. На нём 300 нейронов, 81 модель из 96, 5 агентов, 5 баз знаний, 50 сообщений к платным моделям каждые 4 часа, поиск в интернете и 30 минут проектов в сутки. Нейрон — примерно 3 ₽, так что рублёвая цена модели считается из таблицы выше одним умножением.

Выше по линейке: «Стандартный» за 2 690 ₽ — те же 81 модель, 750 нейронов, 40 агентов и 150 сообщений; PRO за 4 990 ₽ — все 96 моделей, включая уровень MAX, 1 650 нейронов, 60 агентов и без лимита сообщений; Ultra за 9 990 ₽ — 3 350 нейронов и 2 места. Флагманских моделей в каталоге 29, Grok 4.6 — одна из них. Что брать под свои задачи, разобрано в материале какой тариф выбрать.

На бесплатном тарифе Grok 4.6 нет: там 52 модели из 96, 100 нейронов один раз при регистрации, 15 сообщений к платным моделям каждые 4 часа и без поиска в интернете. Начать с него всё равно разумно: бесплатные модели — их в каталоге две, openrouter/free и gpt-oss-20b — нейроны не тратят и лимит сообщений не расходуют, так что интерфейс можно освоить бесплатно. Карточка модели со всеми параметрами — на странице Grok 4.6.