Верхнюю строчку по индексу Artificial Analysis в августе 2026 занимает Claude Fable 5 — но точного балла для неё не публиковали. Дальше идёт Claude Opus 5 с 63 баллами, а третью ступеньку делят Grok 4.6 и GPT-5.6 Sol Max: по 61. Между 63 и 61 — два пункта, а между ценами Opus 5 и Grok 4.6 в каталоге платформы — 2,4 раза по входу и 4 раза по выходу.
Это первая оговорка из нескольких. Спор о том, какая лучшая нейросеть 2026 года, обычно ведут вокруг одного числа, а числа хватает далеко не на все модели: активных моделей в каталоге 96, индекс известен по единицам. Поэтому там, где балла нет, ниже стоит пометка или прочерк, а не придуманная цифра.
Рейтинг ИИ-моделей: у кого индекс выше и сколько это стоит
| Модель | Индекс Artificial Analysis | Нейронов за 1 млн вход / выход | Уровень доступа |
|---|---|---|---|
| Claude Fable 5 | выше, чем у Opus 5; точный балл не публиковался | 2 000 / 10 000 | MAX — тариф PRO, 4 990 ₽ |
| Claude Opus 5 | 63 | 650 / 3 250 | MAX — тариф PRO, 4 990 ₽ |
| Grok 4.6 | 61 | 270 / 810 | STANDARD — тариф «Старт», 890 ₽ |
| GPT-5.6 Sol Max | 61 | каталожная строка gpt-5.6-sol: 800 / 4 800 | MAX — тариф PRO, 4 990 ₽ |
| Grok 4.5 | 56 | 270 / 810 | STANDARD, категория LEGACY |
| Grok 4.3 | на 23 пункта ниже, чем у 4.6 | 163 / 325 | STANDARD, категория LEGACY |
В каталоге 96 активных моделей, из них 29 флагманских. Индекс считают не для всех — цифры выше есть только по этим строкам, остальное пришлось бы домысливать. И посмотрите на четвёртый столбец: вся верхушка таблицы, кроме Grok 4.6, требует уровня доступа MAX, то есть тарифа PRO за 4 990 ₽.
Индекс Artificial Analysis — композит, а не истина
Индекс собирают из нескольких бенчмарков и усредняют до одного числа. Удобно для таблицы и плохо для решения: усреднение прячет ровно то, что вам важно. Модель может добирать индекс на знаниях и рассуждениях и при этом заметно проваливаться там, где вы её собирались использовать.
Наглядный пример на одной модели. У Grok 4.6 на Terminal-Bench v2.1 — 88,4%, а на Terminal-Bench v3.0 — 26%. Это один и тот же бенчмарк в разных версиях: старая проще, новая жёстче. Модель не «умная на 88%» и не «слабая на 26%» — она разная на разных нагрузках, а в индекс уходит только след от этого разброса.
Почему самая умная нейросеть — почти никогда не та, что нужна вам
Начнём с денег. Opus 5 стоит 650 нейронов за миллион входных токенов и 3 250 за миллион выходных, Grok 4.6 — 270 и 810. За два пункта индекса вы отдаёте вчетверо больше на выходе, а выходные токены у всех флагманов каталога дороже входных — и именно выход растёт, когда модель начинает подробно рассуждать.
Дальше доступ. Opus 5 и Fable 5 сидят на уровне MAX — это тариф PRO за 4 990 ₽ и ничего ниже. Grok 4.6 — уровень STANDARD, то есть открывается уже на «Старте» за 890 ₽. На бесплатном тарифе видно 52 модели из 96, и ни одной из верхушки рейтинга там нет; как соотносятся лимиты и уровни доступа, разобрано в материале какой тариф выбрать.
Три вопроса вместо рейтинга
- Доступна ли модель на вашем тарифе. Уровень MAX — это PRO за 4 990 ₽, уровень STANDARD — «Старт» за 890 ₽. Самая умная модель, до которой вы не дотягиваетесь тарифом, для вас не существует.
- Сколько нейронов съест обычный рабочий день. Считайте по выходу: у Opus 5 это 3 250 за миллион токенов, у Grok 4.6 — 810, у gpt-5.6-luna — 87. При 300 нейронах на «Старте» и 1 650 на PRO это принципиально разные режимы работы.
- Проигрывает ли на вашей задаче дешёвая модель. gpt-5.6-luna стоит 14 / 87, gemini-3.7-flash — 56 / 281, qwen3.7-flash — 4 / 18. На пересказе, черновиках и рутинной переписке разницу с флагманом за 650 / 3 250 вы можете не увидеть вообще.
| Модель | Нейронов за 1 млн вход / выход | Контекст | Уровень доступа |
|---|---|---|---|
| qwen3.7-flash | 4 / 18 | нет данных | BASIC — самая дешёвая в каталоге |
| gpt-5.6-luna | 14 / 87 | 1 050 000 | BASIC, флагман |
| gpt-5.6-luna-pro | 14 / 87 | 1 050 000 | STANDARD, флагман |
| gemini-3.7-flash | 56 / 281 | 1 048 576 | BASIC, флагман |
| gpt-5.6-terra | 150 / 900 | 1 050 000 | STANDARD, флагман |
| gemini-3.1-pro | 250 / 1 500 | 1 048 576 | STANDARD |
| claude-sonnet-5 | 290 / 1 450 | 1 000 000 | STANDARD |
| qwen3.8-max | 300 / 900 | 1 000 000 | BASIC |
| kimi-k3 | 600 / 3 000 | 1 048 576 | STANDARD |
Индекса Artificial Analysis по этим строкам нет, поэтому сравнивать их с верхушкой одним числом не получится — только своими задачами. Зато видно порядок цен: между qwen3.7-flash за 4 / 18 и claude-5-fable за 2 000 / 10 000 разница в сотни раз, и почти всегда рабочий день складывается из задач обоих типов. Как раскладывать поток по моделям — в материале как тратить меньше нейронов, а откуда вообще берутся нейроны — в нейроны и токены.
Умная за разумные деньги: Grok 4.6 за 270 / 810
Это главный практический вывод из рейтинга. Grok 4.6 набирает 61 по индексу и стоит 270 / 810 нейронов при уровне доступа STANDARD. Единственные модели с индексом выше — Claude Opus 5 и Claude Fable 5 — сидят на уровне MAX. Значит, Grok 4.6 сейчас самый умный вариант, доступный на тарифе за 890 ₽; параметры и лимиты собраны в карточке модели. В каталоге она подписана «SpaceXAI: Grok 4.6» — SpaceXAI и xAI это одна компания, обе формы в ходу.
Цена в нейронах, кстати, сходится с официальной: 270 / 810 — это те самые 2 и 6 долларов за миллион токенов у xAI плюс наценка платформы. И это ровно столько же, сколько стоит Grok 4.5: релиз не подорожал.
Что это вообще за релиз. Grok 4.6 вышла 12 августа 2026 и официально описана как доработка после обучения: удлинённое дополнительное обучение, заново собранное SFT и обучение с подкреплением в агентных средах. Базовая модель та же, что у 4.5, — если вы читали обзор Grok 4.5, архитектурно ничего нового не появилось. Контекст остался 500 000 токенов, знания — до 1 февраля 2026, на вход в каталоге идут текст, изображения и файлы, на выходе только текст. Из заметных изменений в интерфейсе — параметр reasoning_effort, которого у 4.5 не было.
| Замер | Grok 4.5 | Grok 4.6 |
|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 61 |
| GDPval-AA v2, Elo | 1 526 | 1 753 |
| AA-Briefcase, Elo | 1 313 | 1 577 |
| DeepSWE v1.1 | на 11,9 пункта ниже | 65,9% |
| Terminal-Bench v3.0 | 15,7% | 26% |
| Terminal-Bench v2.1 | — | 88,4% |
| CursorBench v3.2 | — | 69,9% |
| FrontierCode v1.1 Extended | — | 61,3% |
| APEX-Agents | — | 57,5% |
| τ³-Banking | — | 50,7% |
Прочерк означает, что цифру по 4.5 в источниках не приводили, а не ноль. На GDPval-AA v2 с результатом 1 753 Elo впереди Grok 4.6 остаётся только Claude Opus 5, а на τ³-Banking с 50,7% она входит в двойку лучших. Плюс за месяц индекс вырос с 56 до 61 — для доработки после обучения это много.
Отдельно про экономику работы, и это сильная сторона. Задача решается в среднем за 53 хода и около 0,5 млрд входных токенов, тогда как Claude Opus 5 тратит примерно 103 хода и 2,0 млрд. Замеренная стоимость задачи — 0,84 доллара. Для агентных сценариев, где модель десятки раз ходит по инструментам, это важнее двух пунктов индекса; подробное сравнение — в материале Grok 4.6 против Claude Opus 5.
Слабые места: где Grok 4.6 проигрывает
- По индексу она третья, а не первая. Выше — Claude Opus 5 с 63 и Claude Fable 5. Формулировка «самая умная модель» к Grok 4.6 не подходит.
- На своей ступеньке она не одна: 61 балл и у GPT-5.6 Sol Max.
- Terminal-Bench v3.0 — 26%. Рост с 15,7% почти двукратный, но в абсолюте это провал: почти три четверти терминальных задач модель не доводит до конца.
- DeepSWE v1.1 — 65,9% против 73% у GPT-5.6 Sol Max. В инженерных задачах Grok уступает прямому конкуренту, и если код — ваш основной сценарий, начните с подборки нейросети для кода.
- Это доработка после обучения, а не новая базовая модель. Ждать качественного скачка там, где 4.5 была бессильна, не стоит.
- Контекст 500 000 токенов не изменился с 4.5 и меньше, чем у соседей по каталогу: у gemini-3.7-flash и gemini-3.1-pro — 1 048 576, у линейки gpt-5.6 — 1 050 000, у claude-sonnet-5 — 1 000 000. Самый большой контекст в каталоге у grok-4.20-beta — 2 000 000 при цене 200 / 400, но это категория LEGACY.
- В собственной таблице xAI из десяти строк больше всего первых мест берёт Claude Fable 5 Max. Grok 4.6 выигрывает в работе со знаниями и в юридических задачах — это её профиль, а не универсальное превосходство.
- Выход только текстовый. Открытых весов нет, self-hosting невозможен: модель живёт в API xAI, Cursor и Grok Build.
Ни один из этих пунктов не отменяет вывода про цену. Но они объясняют, почему рейтинг стоит читать не сверху вниз, а с конца — от того, что вы делаете руками каждый день. Если хочется сравнить кандидатов попарно, есть разборы Grok 4.5 против Claude Sonnet 5 и какую нейросеть выбрать: Grok, GPT или Gemini.
Проверьте на своих задачах, а не по таблице
Личный бенчмарк собирается за полчаса. Возьмите три-пять задач, которые у вас реально повторяются, и прогоните одинаковый промпт через двух-трёх кандидатов: Grok 4.6, что-нибудь дешёвое вроде gpt-5.6-luna за 14 / 87 и, если у вас PRO, Opus 5. Сравнивайте не «кто умнее», а сколько правок вы внесли в ответ и сколько нейронов ушло.
Шаблон для сравнения моделей на своей задаче
Ниже — задача, которую я решаю регулярно. Выполни её полностью, без уточняющих вопросов.
Контекст: [что за работа, для кого, чем закончится]
Входные данные: [текст, таблица, фрагмент кода или ссылка]
Что нужно получить: [формат результата — письмо, таблица, функция, план]
Ограничения: [объём, стиль, что использовать нельзя]
В конце ответа отдельным блоком перечисли: какие места в задаче были неоднозначными и какие допущения ты сделал.Последний абзац промпта — самое полезное. По списку допущений видно, где модель угадывала, а где действительно поняла задачу; на этом различия между 61 и 63 баллами становятся либо заметными, либо очевидно неважными. Отработать сами формулировки можно бесплатно — об этом ниже.
Сколько это стоит: тарифы и доступ
| Тариф | Цена | Нейронов | Моделей из 96 | Агентов | Сообщений к платным моделям за 4 часа |
|---|---|---|---|---|---|
| Бесплатный | 0 ₽ | 100 один раз при регистрации | 52 | 3 | 15 |
| Старт | 890 ₽ | 300 | 81 | 5 | 50 |
| Стандартный | 2 690 ₽ | 750 | 81 | 40 | 150 |
| PRO | 4 990 ₽ | 1 650 | 96 | 60 | без лимита |
| Ultra | 9 990 ₽ | 3 350 | 96 | нет данных | нет данных |
Пара деталей, которые в таблицу не влезли. Баз знаний на бесплатном тарифе две, на «Старте» — пять. Поиск в интернете появляется только с «Старта», там же — 30 минут проектов в сутки; что именно меняется на этом уровне, разобрано в материале тариф «Старт» за 890 ₽. У Ultra в наших данных есть 3 350 нейронов и 2 места, а про число агентов и лимит сообщений данных нет — поэтому в таблице честный «нет данных», а не догадка.
Итог короткий. Если вам нужна верхушка рейтинга — это Claude Fable 5 и Claude Opus 5 с 63 баллами, уровень MAX, тариф PRO за 4 990 ₽. Если нужен максимум ума за разумные деньги — Grok 4.6 за 270 / 810 с 61 баллом, и она открывается на «Старте» за 890 ₽ вместе с поиском в интернете и 30 минутами проектов в сутки. На бесплатном тарифе Grok 4.6 нет, но 100 нейронов при регистрации и 52 модели из 96 хватит, чтобы прогнать свой шаблон сравнения и понять, за какой уровень доступа вам вообще стоит платить.


