Сравнивать семейства целиком некорректно: внутри каждого есть и лёгкие, и флагманские модели. Поэтому сопоставляем сопоставимое — и смотрим на то, что можно проверить.
Что различается объективно
- Цена за миллион токенов — видна в карточке каждой модели.
- Размер контекста — сколько модель прочитает за раз.
- Входные форматы — принимает ли она картинки, аудио, видео.
- Уровень доступа — с какого тарифа открывается.
Где сильна Gemini 3.7 Flash
Сочетание, которое встречается редко: контекст в миллион токенов, вход с видео и аудио, цена 56 нейронов за миллион и доступность на бесплатном тарифе. Для потока разнородных входящих материалов это удобно.
Где обычно берут Claude
Там, где важен текст: длинные рассуждения, аккуратный стиль, работа с кодом. Это выбор под качество формулировок, а не под минимальную цену.
Где обычно берут Grok
Там, где нужна свежесть данных и живой тон. У семейства своя ниша, и она мало пересекается с задачами «разобрать сто страниц документов».
Как выбрать без чужих рейтингов
- Возьмите свою типовую задачу — ту, что делаете регулярно.
- Прогоните на трёх моделях в одном диалоге, переключая их подряд.
- Сравните с эталоном — результатом, который сделали руками.
- Посчитайте расход по плашке стоимости у каждого ответа.
Это занимает минут десять и стоит копейки, зато отвечает на вопрос применительно к вашим текстам, а не к абстрактным тестам.
Сравнение с линейкой GPT — Gemini 3.7 или GPT-5.6. Вся линейка Google — все модели Google.
Бенчмарки: где выигрывает и где нет
Google опубликовала сравнение с Claude Sonnet 5, GPT-5.6 Terra и Muse Spark 1.2. Приводим таблицу целиком — вместе со строками, где Gemini не первая: обзор, который хвалит во всём, читать незачем.
| Тест | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 — качество кода | 43,6% | 34,4% | 42,7% | 41,3% |
| DeepSWE v1.1 — длинные задачи | 65,3% | 48,6% | 53,8% | 69,6% |
| Code Arena — веб-разработка, Elo | 1588 | 1538 | 1541 | 1523 |
| Terminal-bench 2.1 | 85,8% | 78,0% | 80,4% | 87,4% |
| AutomationBench — бизнес-процессы | 30,4% | 17,0% | 10,7% | 23,6% |
| Harvey LAB-AA — юридические задачи | 90,7% | 85,1% | 90,1% | 85,2% |
| GDP.pdf — сложные документы | 34,0% | 22,0% | 28,0% | 24,7% |
| Цена входа за 1 млн | $0,75 | $0,75 | $2,00 | $2,00 |
| Цена выхода за 1 млн | $3,75 | $3,75 | $10,00 | $12,00 |

Что из этого следует
- Выигрывает там, где документы и автоматизация. GDP.pdf — 34% против 22% у предыдущей версии и 28% у Claude. AutomationBench — 30,4% против 10,7% у Claude, почти втрое.
- Выигрывает в веб-разработке. Code Arena 1588 против 1541 у Claude и 1523 у GPT-5.6 Terra.
- Проигрывает на длинных инженерных задачах. DeepSWE 65,3% против 69,6% у GPT-5.6 Terra, и на terminal-bench тоже вторая.
- Главный аргумент — цена. $0,75 за миллион входных против $2 у Claude Sonnet 5 и GPT-5.6 Terra: почти втрое дешевле при сопоставимых результатах.
Что ещё почитать про Gemini 3.7
👉 Попробовать Gemini 3.7 Flash бесплатно — 100 нейронов сразу, без карты. Дальше — СТАРТ за 890 ₽ или больше на старших тарифах.



