В описании модели программирование стоит рядом с агентными сценариями. На практике это значит, что она не только пишет код, но и может его выполнить — если включён нужный режим.

Что имеет смысл поручать

  • Разбор чужого кода — что делает, где узкие места, что сломается при изменении.
  • Обработка данных — распарсить выгрузку, привести форматы, посчитать.
  • Скрипты под разовую задачу — переименовать файлы, собрать отчёт, сверить списки.
  • Тесты к существующей функции — включая крайние случаи, о которых забывают.
  • Объяснение ошибки — по тексту трейсбека и куску кода.

Запуск прямо в чате

В режиме «Задачи» модель выполняет код и показывает результат, а не только текст программы. Это меняет проверку: вы видите, что скрипт действительно отработал на ваших данных. Как включается — режимы «Чат» и «Задачи».

Обработка выгрузки

Вот CSV. Напиши и выполни скрипт: привести даты к одному формату, убрать дубликаты по паре «телефон + дата», посчитать количество по каждому менеджеру. Покажи результат таблицей и отдай очищенный файл.

Разбор кода

Вот функция. Объясни, что она делает, по шагам. Затем перечисли: крайние случаи, на которых она сломается; что произойдёт при пустом входе; что бы ты изменил и почему. Не переписывай код целиком — сначала разбор.

Как проверять

  1. Запускайте на своих данных, а не на придуманном примере.
  2. Просите крайние случаи — пустой вход, дубликаты, неверный формат.
  3. Не принимайте молчание за корректность. Спросите прямо: «где это может сломаться?»
  4. Читайте код, который идёт в работу. Модель ошибается тише, чем человек.

Сколько стоит

Токены модели — 56 и 281 нейрон за миллион. Запуск кода тарифицируется отдельно: 18 нейронов за создание песочницы и 0,1 нейрона за секунду работы. Песочница живёт десять минут после последнего запуска, и всё это время повторные запуски не стоят ничего сверху.

Подборка моделей под код — лучшие нейросети для программирования.

Замеры по коду

Качество production-кода: FrontierCode 1.1 Main
Качество production-кода: FrontierCode 1.1 Main

На FrontierCode 1.1 модель показывает 43,6% против 34,4% у предыдущей версии, 42,7% у Claude Sonnet 5 и 41,3% у GPT-5.6 Terra — то есть впереди обоих конкурентов.

Длинные инженерные задачи: DeepSWE V1.1
Длинные инженерные задачи: DeepSWE V1.1

А вот на длинных инженерных задачах картина другая: 65,3% против 69,6% у GPT-5.6 Terra. Прирост к своей же прошлой версии огромный — с 48,6%, — но лидерство здесь не за ней. В веб-разработке (Code Arena) она снова первая: 1588 Elo против 1541 и 1523.


Что ещё почитать про Gemini 3.7

👉 Попробовать Gemini 3.7 Flash бесплатно — 100 нейронов сразу, без карты. Дальше — СТАРТ за 890 ₽ или больше на старших тарифах.