Вы открываете третий за вечер рейтинг нейросетей и видите третьего лидера. В одном топе первое место у Claude, в другом у GPT, в третьем у Gemini. Все три таблицы могут быть честными — они просто меряют разное, и почти никогда не пишут об этом крупным шрифтом.

Дальше — что именно измеряет каждая популярная метрика, где проходят её границы и как выбирать модель, когда единого топа нейросетей не существует. Цифры здесь двух видов: внешние публичные лидерборды (Artificial Analysis, LMSys Arena) и официальные замеры Google, опубликованные 13.08.2026. Чужие модели мы сами не тестировали и бенчмарки не воспроизводили — всё со ссылкой на источник.

Почему у каждого рейтинга ИИ свой победитель

Публичные лидерборды сравнивают 300–390 моделей по MMLU Pro, HumanEval, MATH, GPQA Diamond, SWE-Bench Verified, скорости и цене. Это семь разных вопросов к модели, а не семь способов задать один. Модель, которая аккуратно чинит баги в чужом репозитории, не обязана нравиться людям в слепом сравнении ответов.

Arena Elo — это голоса людей

На LMSys Arena человек видит два ответа без подписей и выбирает тот, что понравился. Из множества таких голосов считается Elo, как в шахматах. В августе 2026 фронтир держится примерно в диапазоне 1450–1561 — там GPT-5, Claude Opus 4.6, Gemini 3.1 Pro, Grok 4, DeepSeek V3.2. Чего Elo не измеряет — правильность: аккуратно оформленный ответ с ошибкой в третьем абзаце обыгрывает сухой и верный, если проверять никто не стал.

SWE-Bench Verified — это починенные баги

Модели дают реальную задачу из открытого репозитория и смотрят, пройдут ли тесты после её правки. Метрика жёсткая: либо тесты зелёные, либо нет. Но она ничего не говорит про умение объяснять, писать текст или удерживать длинный разговор. Высокий SWE-Bench — это про инженерную работу с кодом и почти ни про что другое.

MMLU Pro и GPQA Diamond — это экзамен

Закрытые вопросы с вариантами ответов по многим дисциплинам; GPQA Diamond — уровень аспирантуры по естественным наукам. Здесь проверяется эрудиция и способность рассуждать в жёстком формате. Чему это не равно: работе с вашими файлами, следованию инструкции на десять пунктов и поведению на длинной задаче, где важно не сорваться на сороковом шаге.

Разброс между верхними моделями меньше, чем кажется по заголовкам статей. Весь фронтир на Arena Elo умещается в 1450–1561 — чуть больше сотни очков, и в обычной переписке эту разницу вы можете просто не заметить. У Artificial Analysis первые два места разделяет один пункт: 63,1 против 62,1. Подробнее о том, как устроены такие индексы, — в разборе какая нейросеть самая умная.

Официальные замеры Google от 13 августа 2026

Вместе с выходом Gemini 3.7 Flash компания Google опубликовала сравнение с предыдущей версией и двумя конкурентами. Это данные вендора о собственной модели — читать их стоит с поправкой на то, кто выбирал набор тестов. Тем интереснее строки, где вендор проигрывает: они в таблице есть.

ТестGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.1 (качество кода)43,6%34,4%42,7%41,3%
DeepSWE v1.1 (длинные задачи)65,348,653,869,6
Code Arena, Elo1588153815411523
Terminal-bench 2.185,878,080,487,4
AutomationBench30,417,010,723,6
GDPVal-AA1525142215981578
GDP.pdf (документы)34,022,028,024,7
Официальные замеры Google, опубликованы 13.08.2026

Gemini 3.7 Flash забирает четыре строки из семи, и в двух — с заметным отрывом. AutomationBench: 30,4 против 23,6 у GPT-5.6 Terra и 10,7 у Claude Sonnet 5. Работа с документами, GDP.pdf: 34,0 против 28,0 и 24,7. На Code Arena — 1588 Elo против 1541 и 1523.

А теперь строки, которые в пересказах обычно теряются. На DeepSWE v1.1 — длинных многошаговых задачах — впереди GPT-5.6 Terra: 69,6 против 65,3. На Terminal-bench 2.1 снова он: 87,4 против 85,8. На GDPVal-AA Gemini с 1525 уступает и Claude Sonnet 5 (1598), и GPT-5.6 Terra (1578), а выше всех там вообще Muse Spark — 1628, модель, которой в основной четвёрке нет.

Почему топ нейросетей устаревает от одного релиза

Gemini 3.7 Flash вышла 13.08.2026 и заняла место 3.6 Flash как модель платформы по умолчанию. На FrontierCode 1.1 результат вырос с 34,4% до 43,6%, на AutomationBench — с 17,0 до 30,4, на GDP.pdf — с 22,0 до 34,0. Разрыв между двумя версиями одного вендора здесь часто больше, чем разрыв между вендорами в той же строке.

Практический вывод простой: рейтинг, собранный весной, к августу описывает уже не тот рынок. Любую таблицу — включая нашу сводную — читайте вместе с датой замера. И не стройте рабочий процесс вокруг одной-единственной модели: смена лидера в вашей категории случается чаще, чем хотелось бы.

Цена — это часть рейтинга, и её обычно не показывают

Место в таблице ничего не говорит о том, во сколько обойдётся тысяча запросов. Между моделями из таблицы Google разница по цене входа — почти в три раза, а по цене выхода — больше чем в три.

МодельВходВыход
Gemini 3.7 Flash$0,75$3,75
Claude Sonnet 5$2,00$10,00
GPT-5.6 Terra$2,00$12,00
Muse Spark$1,25$4,25
Цены вендоров за 1 млн токенов, август 2026

Цена Gemini промо-акционная: она держится до 31.12.2026, дальше вход $1,50 и выход $7,50. После повышения Gemini останется дешевле Claude Sonnet 5 и GPT-5.6 Terra, но по входу проиграет Muse Spark — у неё $1,25. На FrontierCode Gemini и Claude расходятся на 0,9 процентного пункта (43,6% против 42,7%), а по цене выхода — почти втрое: $3,75 против $10,00. Для большинства рабочих задач такой выбор перестаёт быть спорным.

Как рейтинг превращается в нейроны

На платформе вы платите не за токены, а за нейроны — примерно 3 ₽ за штуку. У Gemini 3.7 Flash, модели по умолчанию, вход стоит 56 нейронов за 1 млн токенов, выход — 281. Контекст — 1 048 576 токенов, максимальный ответ — 65 536; на вход принимаются текст, картинки, видео, аудио и файлы.

Как это выглядит на боевом биллинге:

  • разбор договора на 15 страниц — около 4 нейронов
  • ревью кода — около 3
  • ответ сильной модели на сложный вопрос — около 12
  • выжимка большого отчёта — около 20
  • картинка в MediaLab — около 30
  • минута работы проекта в песочнице — ровно 1 нейрон

Обычная переписка почти ничего не стоит: у лёгких моделей ответ — доли нейрона. Бесплатные модели не тратят нейроны вообще и не расходуют лимит сообщений — это отдельный рычаг, если считаете расход; способы собраны в материале как тратить меньше нейронов.

Какая модель на каком тарифе

Место в рейтинге ничего не значит, если модели нет в вашем плане. Gemini 3.7 Flash доступна с бесплатного тарифа — вместе с Qwen3.8 Max, DeepSeek V4 Pro, DeepSeek R1, GPT-5.6 Luna и Llama 4 Maverick; всего на бесплатном открыто 52 модели из 95.

Claude Sonnet 5 и GPT-5.6 Terra — те самые, что стоят в таблице Google рядом с Gemini, — начинаются с тарифа «Старт» за 890 ₽: на нём и на «Стандартном» доступна 81 модель. Топовые вроде GPT-5.6 Sol Pro открываются только на PRO за 4 990 ₽, где видны все 95 и снят лимит сообщений.

Нейрон стоит около 3 ₽, но точная цена зависит от плана: «Старт» — 2,97 ₽, «Стандартный» — 3,59 ₽, PRO — 3,02 ₽, Ultra — 2,98 ₽. Разброс маленький, поэтому план выбирают по объёму и доступу, а не по цене за штуку: «Старт» — 300 нейронов, «Стандартный» за 2 690 ₽ — 750, PRO — 1 650, Ultra за 9 990 ₽ — 3 350 и второе место в команде.

Чего рейтинг нейросетей не покажет

  • Бенчмарк меряет средний случай, а вам важен ваш. Модель с 43,6% на FrontierCode может стабильно спотыкаться именно на вашем стеке.
  • Набор тестов выбирает тот, кто их публикует. Замер, где модель слабее, в подборку может просто не попасть.
  • Arena Elo награждает форму. Голосующий редко проверяет факты в ответе, за который отдал голос.
  • Даты не совпадают. Разные строки одной сводной таблицы часто собраны с разницей в месяцы.
  • Доступность важнее места. Модель из первой строки бесполезна, если её нет на вашем тарифе или ответа приходится ждать дольше, чем вы готовы.

Как выбирать модель без рейтинга

  1. Опишите задачу одним предложением: длинный документ, код, быстрые ответы, генерация изображения.
  2. Возьмите двух-трёх кандидатов из подходящей категории, а не из общего топ-10 нейросетей.
  3. Прогоните через каждого один и тот же реальный пример — свой рабочий, не учебный.
  4. Сравните не только качество ответа, но и расход нейронов со временем ожидания.
  5. Зафиксируйте выбор на месяц и пересмотрите после следующего крупного релиза.

Промпт для собственного мини-теста модели

Ты — модель, которую я тестирую под конкретную задачу.
Вот мой реальный рабочий материал: [вставьте документ, кусок кода или текст].

Задача: [опишите, что нужно сделать].

Сделай работу, а после ответа отдельным блоком напиши:
1) что в исходных данных было неоднозначным;
2) где ты не уверен в результате и почему;
3) чего тебе не хватило, чтобы сделать лучше.

Не смягчай формулировки.

Если возиться с выбором не хочется, в интерфейсе есть режим «Лайт»: вместо каталога — сценарии («Универсальная», «Мгновенные ответы», «Сложные задачи», «Тексты и статьи», «Поиск в интернете», «Бесплатная», «Российская»), и рядом с каждым написано «≈ N нейронов за ответ» уже с наценкой. Артефакты — рабочие страницы прямо в чате — работают на всех тарифах, включая бесплатный, а проекты с сервером начинаются со «Старта». Как устроен режим — в разборе режима «Лайт», а подбор под конкретный тип работы — в материале какую нейросеть выбрать под задачу.

Что брать: короткий вывод

ЗадачаЧто братьОснование
Переписка, черновики, быстрые ответыGemini 3.7 Flash или бесплатные моделидоли нейрона за ответ, бесплатные не тратят нейроны вовсе
Длинные многошаговые задачи, терминалGPT-5.6 Terra69,6 на DeepSWE и 87,4 на Terminal-bench против 65,3 и 85,8
Документы, PDF, файлыGemini 3.7 Flash34,0 на GDP.pdf против 28,0 и 24,7
Автоматизация и агентыGemini 3.7 Flash30,4 на AutomationBench против 23,6 и 10,7
Разнородная деловая работаClaude Sonnet 51598 на GDPVal-AA — лучший из четвёрки, но в самом замере выше Muse Spark (1628)
Что брать под задачу — по официальным замерам Google от 13.08.2026

И честная оговорка к этой таблице: между Gemini 3.7 Flash и Claude Sonnet 5 на FrontierCode разница 0,9 процентного пункта — 43,6% против 42,7%. Это тот случай, когда разница не стоит ни доплаты, ни смены привычной модели; переключаться имеет смысл там, где отрыв измеряется десятками пунктов, как на AutomationBench.

По тарифам вывод такой же прямой. Для текстов, документов и переписки хватит «Старта» за 890 ₽ — там уже есть и Claude Sonnet 5, и GPT-5.6 Terra, и поиск в интернете, и 30 минут проектов в сутки. «Стандартный» за 2 690 ₽ берут ради объёма (750 нейронов, 40 агентов, 150 сообщений каждые 4 часа), а не ради новых моделей: каталог тот же 81. PRO за 4 990 ₽ оправдан в двух случаях — вы упираетесь в лимит сообщений (на PRO его нет) или вам нужны модели уровня GPT-5.6 Sol Pro.