Обновления
GLM 5.3 Prime и Qwen3.8 Max Prime в каталоге: те же модели, только быстрее
С 26 сентября в каталоге СуперИнтеллекта — GLM 5.3 Prime и Qwen3.8 Max Prime: те же модели, что GLM 5.3 и Qwen3.8 Max, но, как заявлено, отвечают в 1,5–2 раза быстрее, а токен стоит примерно вдвое дороже. Обе есть на бесплатном тарифе. Разбираем, когда брать Prime.
Команда СуперИнтеллекта · · ~5 мин

С 26 сентября 2026 года в каталоге СуперИнтеллекта есть GLM 5.3 Prime и Qwen3.8 Max Prime — скоростные версии GLM 5.3 от Z.ai и Qwen3.8 Max от Alibaba. Модели те же, но ответ, как заявлено, приходит в 1,5–2 раза быстрее. Цена токена у Prime примерно вдвое выше. Обе новинки доступны на бесплатном тарифе и на всех платных — в России без VPN и зарубежной карты. Перед запуском мы проверили обе модели в работе.
Что такое Prime-версия модели?
Prime — это не новая модель, а та же нейросеть на ускоренном выводе. Веса, то есть всё, чему модель научилась при обучении, не меняются, поэтому возможности у Prime и обычной версии одинаковые. Ускоряется только выдача ответа: модель запускают так, чтобы она быстрее генерировала токены — кусочки слов, из которых складывается текст. За скорость берут отдельную цену: Prime продаётся отдельной позицией и стоит примерно вдвое дороже базовой версии.
Обе Prime-версии вышли 23–24 сентября, а через пару дней мы добавили их в каталог. Характеристики моделей удобно сравнить на странице OpenRouter; о выходе Qwen3.8 Max Prime писал DataNorth.
Чем отличаются GLM 5.3 Prime и Qwen3.8 Max Prime?
Это модели разного уровня: GLM 5.3 Prime — повседневная, Qwen3.8 Max Prime — флагманская.
- GLM 5.3 Prime от Z.ai работает с текстом и сделана под сложную разработку и долгие агентные задачи: умеет рассуждать и вызывать инструменты. Окно контекста — объём текста, который модель держит в памяти за один запрос, — 1 млн токенов, ответ — до 131 тыс. токенов. По стороннему замеру, модель выдаёт около 75 токенов в секунду, а первый токен появляется через 1,3 секунды (медиана).
- Qwen3.8 Max Prime от Alibaba — ускоренная версия флагмана Qwen. Принимает текст, изображения и видео, отвечает текстом, умеет вызывать инструменты и выдавать структурированный ответ. Окно контекста — 1 млн токенов. Режим рассуждений включён по умолчанию: перед ответом модель думает.
| Что сравниваем | Обычная версия | Prime |
|---|---|---|
| Модель и её возможности | Те же | Те же |
| Скорость ответа | Базовая | В 1,5–2 раза выше (заявлено) |
| Цена токена | Базовая | Примерно вдвое выше |
| Тариф в СуперИнтеллекте | Бесплатный и все платные | Бесплатный и все платные |
| Когда брать | Объём, фоновые задачи, экономия | Живой диалог, агенты, длинные ответы |
Когда стоит выбрать Prime?
Когда время ответа важнее цены. Качество у Prime то же, так что вы платите только за скорость — и она окупается там, где модель ждёт человек или следующий шаг работы.
- Живой диалог. Мозговой штурм, правка текста на ходу, разговор, в котором вы уточняете формулировки реплика за репликой: каждая лишняя пауза сбивает темп.
- Агенты с множеством шагов. Агент по очереди ищет, читает, вызывает инструменты и снова думает. Задержки каждого шага складываются, поэтому более быстрые ответы модели заметны на задаче целиком.
- Длинные ответы. Большой отчёт или код на сотни строк появляется быстрее, и разница тем заметнее, чем длиннее ответ.
Когда хватит обычной версии?
Почти во всех остальных случаях — там, где секунды не решают.
- Объём. Прогнать через модель пачку документов, писем или описаний товаров: здесь считаются нейроны, а не секунды.
- Фоновые задачи. Если ответ всё равно прочитают позже, платить вдвое за скорость незачем.
- Экономия. Нейроны списываются по фактическому расходу токенов, а токен у обычных GLM 5.3 и Qwen3.8 Max примерно вдвое дешевле, поэтому ответ такой же длины обойдётся примерно вдвое дешевле.
Как попробовать GLM 5.3 Prime и Qwen3.8 Max Prime?
Обе модели уже в каталоге СуперИнтеллекта — на бесплатном тарифе и на всех платных. Регистрация бесплатная, платформа работает в России без VPN и зарубежной карты, оплата в рублях.
- Где найти. В списке моделей они подписаны «Z.ai: GLM 5.3 Prime» и «Qwen: Qwen3.8 Max Prime». Модель меняется в чате одним кликом.
- Сравните сами. Задайте один и тот же вопрос обычной версии и Prime в разных чатах: разница в скорости видна сразу.
- Глубина рассуждений. Если у модели есть ступени рассуждений, чип рядом с её названием открывает шкалу «Быстрее ↔ Умнее». На простых вопросах ступень пониже добавит скорости — подробнее о шкале.
- Не хочется выбирать вовсе? Автоматическая модель СуперИнтеллект сама подбирает нейросеть и глубину рассуждений под задачу и тоже доступна на бесплатном тарифе.
Частые вопросы
Prime-версии умнее обычных?
Нет. Веса у них те же, что у GLM 5.3 и Qwen3.8 Max, поэтому возможности одинаковые. Prime, как заявлено, выдаёт ответ в 1,5–2 раза быстрее, но токен стоит примерно вдвое дороже.
Доступны ли Prime-модели на бесплатном тарифе?
Да. GLM 5.3 Prime и Qwen3.8 Max Prime есть на бесплатном тарифе и на всех платных. Нейроны списываются по фактическому расходу токенов.
Какую Prime выбрать: GLM или Qwen?
Если нужно разбирать изображения или видео, берите Qwen3.8 Max Prime: это флагман, и он принимает не только текст. GLM 5.3 Prime работает с текстом и сделана под разработку и долгие агентные задачи.
Читать также: Новые нейросети сентября 2026 · Grok 4.7 вышел · Ход работы агента — в одну строку