Вы открываете третий за вечер рейтинг нейросетей и видите третьего лидера. В одном топе первое место у Claude, в другом у GPT, в третьем у Gemini. Все три таблицы могут быть честными — они просто меряют разное, и почти никогда не пишут об этом крупным шрифтом.
Дальше — что именно измеряет каждая популярная метрика, где проходят её границы и как выбирать модель, когда единого топа нейросетей не существует. Цифры здесь двух видов: внешние публичные лидерборды (Artificial Analysis, LMSys Arena) и официальные замеры Google, опубликованные 13.08.2026. Чужие модели мы сами не тестировали и бенчмарки не воспроизводили — всё со ссылкой на источник.
Почему у каждого рейтинга ИИ свой победитель
Публичные лидерборды сравнивают 300–390 моделей по MMLU Pro, HumanEval, MATH, GPQA Diamond, SWE-Bench Verified, скорости и цене. Это семь разных вопросов к модели, а не семь способов задать один. Модель, которая аккуратно чинит баги в чужом репозитории, не обязана нравиться людям в слепом сравнении ответов.
Arena Elo — это голоса людей
На LMSys Arena человек видит два ответа без подписей и выбирает тот, что понравился. Из множества таких голосов считается Elo, как в шахматах. В августе 2026 фронтир держится примерно в диапазоне 1450–1561 — там GPT-5, Claude Opus 4.6, Gemini 3.1 Pro, Grok 4, DeepSeek V3.2. Чего Elo не измеряет — правильность: аккуратно оформленный ответ с ошибкой в третьем абзаце обыгрывает сухой и верный, если проверять никто не стал.
SWE-Bench Verified — это починенные баги
Модели дают реальную задачу из открытого репозитория и смотрят, пройдут ли тесты после её правки. Метрика жёсткая: либо тесты зелёные, либо нет. Но она ничего не говорит про умение объяснять, писать текст или удерживать длинный разговор. Высокий SWE-Bench — это про инженерную работу с кодом и почти ни про что другое.
MMLU Pro и GPQA Diamond — это экзамен
Закрытые вопросы с вариантами ответов по многим дисциплинам; GPQA Diamond — уровень аспирантуры по естественным наукам. Здесь проверяется эрудиция и способность рассуждать в жёстком формате. Чему это не равно: работе с вашими файлами, следованию инструкции на десять пунктов и поведению на длинной задаче, где важно не сорваться на сороковом шаге.
Разброс между верхними моделями меньше, чем кажется по заголовкам статей. Весь фронтир на Arena Elo умещается в 1450–1561 — чуть больше сотни очков, и в обычной переписке эту разницу вы можете просто не заметить. У Artificial Analysis первые два места разделяет один пункт: 63,1 против 62,1. Подробнее о том, как устроены такие индексы, — в разборе какая нейросеть самая умная.
Официальные замеры Google от 13 августа 2026
Вместе с выходом Gemini 3.7 Flash компания Google опубликовала сравнение с предыдущей версией и двумя конкурентами. Это данные вендора о собственной модели — читать их стоит с поправкой на то, кто выбирал набор тестов. Тем интереснее строки, где вендор проигрывает: они в таблице есть.
| Тест | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 (качество кода) | 43,6% | 34,4% | 42,7% | 41,3% |
| DeepSWE v1.1 (длинные задачи) | 65,3 | 48,6 | 53,8 | 69,6 |
| Code Arena, Elo | 1588 | 1538 | 1541 | 1523 |
| Terminal-bench 2.1 | 85,8 | 78,0 | 80,4 | 87,4 |
| AutomationBench | 30,4 | 17,0 | 10,7 | 23,6 |
| GDPVal-AA | 1525 | 1422 | 1598 | 1578 |
| GDP.pdf (документы) | 34,0 | 22,0 | 28,0 | 24,7 |
Gemini 3.7 Flash забирает четыре строки из семи, и в двух — с заметным отрывом. AutomationBench: 30,4 против 23,6 у GPT-5.6 Terra и 10,7 у Claude Sonnet 5. Работа с документами, GDP.pdf: 34,0 против 28,0 и 24,7. На Code Arena — 1588 Elo против 1541 и 1523.
А теперь строки, которые в пересказах обычно теряются. На DeepSWE v1.1 — длинных многошаговых задачах — впереди GPT-5.6 Terra: 69,6 против 65,3. На Terminal-bench 2.1 снова он: 87,4 против 85,8. На GDPVal-AA Gemini с 1525 уступает и Claude Sonnet 5 (1598), и GPT-5.6 Terra (1578), а выше всех там вообще Muse Spark — 1628, модель, которой в основной четвёрке нет.
Почему топ нейросетей устаревает от одного релиза
Gemini 3.7 Flash вышла 13.08.2026 и заняла место 3.6 Flash как модель платформы по умолчанию. На FrontierCode 1.1 результат вырос с 34,4% до 43,6%, на AutomationBench — с 17,0 до 30,4, на GDP.pdf — с 22,0 до 34,0. Разрыв между двумя версиями одного вендора здесь часто больше, чем разрыв между вендорами в той же строке.
Практический вывод простой: рейтинг, собранный весной, к августу описывает уже не тот рынок. Любую таблицу — включая нашу сводную — читайте вместе с датой замера. И не стройте рабочий процесс вокруг одной-единственной модели: смена лидера в вашей категории случается чаще, чем хотелось бы.
Цена — это часть рейтинга, и её обычно не показывают
Место в таблице ничего не говорит о том, во сколько обойдётся тысяча запросов. Между моделями из таблицы Google разница по цене входа — почти в три раза, а по цене выхода — больше чем в три.
| Модель | Вход | Выход |
|---|---|---|
| Gemini 3.7 Flash | $0,75 | $3,75 |
| Claude Sonnet 5 | $2,00 | $10,00 |
| GPT-5.6 Terra | $2,00 | $12,00 |
| Muse Spark | $1,25 | $4,25 |
Цена Gemini промо-акционная: она держится до 31.12.2026, дальше вход $1,50 и выход $7,50. После повышения Gemini останется дешевле Claude Sonnet 5 и GPT-5.6 Terra, но по входу проиграет Muse Spark — у неё $1,25. На FrontierCode Gemini и Claude расходятся на 0,9 процентного пункта (43,6% против 42,7%), а по цене выхода — почти втрое: $3,75 против $10,00. Для большинства рабочих задач такой выбор перестаёт быть спорным.
Как рейтинг превращается в нейроны
На платформе вы платите не за токены, а за нейроны — примерно 3 ₽ за штуку. У Gemini 3.7 Flash, модели по умолчанию, вход стоит 56 нейронов за 1 млн токенов, выход — 281. Контекст — 1 048 576 токенов, максимальный ответ — 65 536; на вход принимаются текст, картинки, видео, аудио и файлы.
Как это выглядит на боевом биллинге:
- разбор договора на 15 страниц — около 4 нейронов
- ревью кода — около 3
- ответ сильной модели на сложный вопрос — около 12
- выжимка большого отчёта — около 20
- картинка в MediaLab — около 30
- минута работы проекта в песочнице — ровно 1 нейрон
Обычная переписка почти ничего не стоит: у лёгких моделей ответ — доли нейрона. Бесплатные модели не тратят нейроны вообще и не расходуют лимит сообщений — это отдельный рычаг, если считаете расход; способы собраны в материале как тратить меньше нейронов.
Какая модель на каком тарифе
Место в рейтинге ничего не значит, если модели нет в вашем плане. Gemini 3.7 Flash доступна с бесплатного тарифа — вместе с Qwen3.8 Max, DeepSeek V4 Pro, DeepSeek R1, GPT-5.6 Luna и Llama 4 Maverick; всего на бесплатном открыто 52 модели из 95.
Claude Sonnet 5 и GPT-5.6 Terra — те самые, что стоят в таблице Google рядом с Gemini, — начинаются с тарифа «Старт» за 890 ₽: на нём и на «Стандартном» доступна 81 модель. Топовые вроде GPT-5.6 Sol Pro открываются только на PRO за 4 990 ₽, где видны все 95 и снят лимит сообщений.
Нейрон стоит около 3 ₽, но точная цена зависит от плана: «Старт» — 2,97 ₽, «Стандартный» — 3,59 ₽, PRO — 3,02 ₽, Ultra — 2,98 ₽. Разброс маленький, поэтому план выбирают по объёму и доступу, а не по цене за штуку: «Старт» — 300 нейронов, «Стандартный» за 2 690 ₽ — 750, PRO — 1 650, Ultra за 9 990 ₽ — 3 350 и второе место в команде.
Чего рейтинг нейросетей не покажет
- Бенчмарк меряет средний случай, а вам важен ваш. Модель с 43,6% на FrontierCode может стабильно спотыкаться именно на вашем стеке.
- Набор тестов выбирает тот, кто их публикует. Замер, где модель слабее, в подборку может просто не попасть.
- Arena Elo награждает форму. Голосующий редко проверяет факты в ответе, за который отдал голос.
- Даты не совпадают. Разные строки одной сводной таблицы часто собраны с разницей в месяцы.
- Доступность важнее места. Модель из первой строки бесполезна, если её нет на вашем тарифе или ответа приходится ждать дольше, чем вы готовы.
Как выбирать модель без рейтинга
- Опишите задачу одним предложением: длинный документ, код, быстрые ответы, генерация изображения.
- Возьмите двух-трёх кандидатов из подходящей категории, а не из общего топ-10 нейросетей.
- Прогоните через каждого один и тот же реальный пример — свой рабочий, не учебный.
- Сравните не только качество ответа, но и расход нейронов со временем ожидания.
- Зафиксируйте выбор на месяц и пересмотрите после следующего крупного релиза.
Промпт для собственного мини-теста модели
Ты — модель, которую я тестирую под конкретную задачу.
Вот мой реальный рабочий материал: [вставьте документ, кусок кода или текст].
Задача: [опишите, что нужно сделать].
Сделай работу, а после ответа отдельным блоком напиши:
1) что в исходных данных было неоднозначным;
2) где ты не уверен в результате и почему;
3) чего тебе не хватило, чтобы сделать лучше.
Не смягчай формулировки.Если возиться с выбором не хочется, в интерфейсе есть режим «Лайт»: вместо каталога — сценарии («Универсальная», «Мгновенные ответы», «Сложные задачи», «Тексты и статьи», «Поиск в интернете», «Бесплатная», «Российская»), и рядом с каждым написано «≈ N нейронов за ответ» уже с наценкой. Артефакты — рабочие страницы прямо в чате — работают на всех тарифах, включая бесплатный, а проекты с сервером начинаются со «Старта». Как устроен режим — в разборе режима «Лайт», а подбор под конкретный тип работы — в материале какую нейросеть выбрать под задачу.
Что брать: короткий вывод
| Задача | Что брать | Основание |
|---|---|---|
| Переписка, черновики, быстрые ответы | Gemini 3.7 Flash или бесплатные модели | доли нейрона за ответ, бесплатные не тратят нейроны вовсе |
| Длинные многошаговые задачи, терминал | GPT-5.6 Terra | 69,6 на DeepSWE и 87,4 на Terminal-bench против 65,3 и 85,8 |
| Документы, PDF, файлы | Gemini 3.7 Flash | 34,0 на GDP.pdf против 28,0 и 24,7 |
| Автоматизация и агенты | Gemini 3.7 Flash | 30,4 на AutomationBench против 23,6 и 10,7 |
| Разнородная деловая работа | Claude Sonnet 5 | 1598 на GDPVal-AA — лучший из четвёрки, но в самом замере выше Muse Spark (1628) |
И честная оговорка к этой таблице: между Gemini 3.7 Flash и Claude Sonnet 5 на FrontierCode разница 0,9 процентного пункта — 43,6% против 42,7%. Это тот случай, когда разница не стоит ни доплаты, ни смены привычной модели; переключаться имеет смысл там, где отрыв измеряется десятками пунктов, как на AutomationBench.
По тарифам вывод такой же прямой. Для текстов, документов и переписки хватит «Старта» за 890 ₽ — там уже есть и Claude Sonnet 5, и GPT-5.6 Terra, и поиск в интернете, и 30 минут проектов в сутки. «Стандартный» за 2 690 ₽ берут ради объёма (750 нейронов, 40 агентов, 150 сообщений каждые 4 часа), а не ради новых моделей: каталог тот же 81. PRO за 4 990 ₽ оправдан в двух случаях — вы упираетесь в лимит сообщений (на PRO его нет) или вам нужны модели уровня GPT-5.6 Sol Pro.


