Ox Alpha — модель, которую разработчик прямо позиционирует как инструмент для кода, автономных агентов и промышленного использования. На первом прогоне по задачам программирования она дала 80% против 65% у Claude Fable 5, на полных прогонах осела до 62,8%. Ниже — что это значит на практике и как выжать из неё максимум, не заплатив ни нейрона.

Честно о результатах тестов

Цифра 80% разлетелась по сети первой, и её стоит сразу поставить на место. Она получена на выборке из десяти задач — это первое впечатление, а не бенчмарк. Полные прогоны дают около 63%, причём в одном из них два агента упёрлись в лимит времени в 90 минут.

МодельРезультат
Ox Alpha80%
Claude Fable 565%
GLM-5.362%
Grok 4.662%
GPT-5.6 Sol52%
Первый прогон, 10 задач по коду

Правильный вывод: Ox Alpha попала в весовую категорию платных флагманов, но не возглавила её. Для инструмента, который ничего не стоит и открыт на бесплатном тарифе, этого более чем достаточно.

Где она сильнее всего

Разбор большого репозитория

Миллион токенов — это примерно вся кодовая база среднего проекта. Модель видит связи между модулями, а не отдельный файл в вакууме.

Первый заход в незнакомый проект

Ниже — исходники проекта целиком.

Ответь по пунктам:
1. Архитектура: слои, модули, точка входа, направление зависимостей.
2. Внешние интеграции: какие сервисы дёргаются и откуда.
3. Слабые места: где логика дублируется, где нет обработки ошибок, где легко сломать.
4. Маршрут для новичка: пять файлов, которые нужно прочитать первыми, и почему.

Ссылайся на конкретные пути к файлам. Не придумывай того, чего нет в коде.

[код]

Баг, у которого причина и симптом в разных местах

Самые дорогие по времени баги — те, где падает в одном месте, а виновато другое. Модели с коротким контекстом такие связи не находят в принципе: им показывают только место падения. Здесь можно показать всё, включая скриншот.

Поиск причины по всему проекту

Симптом: [что происходит и при каких условиях]
Ожидаемое поведение: [что должно быть]
Что уже проверили: [список — чтобы не повторяться]

Ниже — код проекта целиком.

Найди причину. Разбери цепочку: где начинается, через что проходит, где проявляется.
Если причин может быть несколько — перечисли и ранжируй по вероятности.
Если данных не хватает — скажи, какой лог или файл нужен.

[код]

Рефакторинг по всей кодовой базе

Задачи вида «переименовать везде», «перевести на другую библиотеку», «унифицировать обработку ошибок». Ценность полного контекста в том, что модель находит все вхождения, а не первые попавшиеся.

Массовое изменение

Задача: [что меняем и на что]

Ниже — код проекта.

Сделай так:
1. Сначала найди ВСЕ места, которых касается изменение. Выведи список: файл, строка, что там сейчас.
2. Дождись, пока я подтвержу список.
3. Только после подтверждения предлагай правки.

Не начинай переписывать, пока я не подтвердил список.

Тесты и документация

Ответ до 131 тысячи токенов позволяет получить полный набор тестов за один заход, а не по одному кейсу. То же с документацией: не «опиши функцию», а «опиши модуль целиком».

Агентские сценарии

Модель поддерживает вызов инструментов и рассчитана на длинные цепочки шагов. Для фоновых агентов, которые не отвечают человеку в реальном времени, её медлительность перестаёт быть проблемой.

Где она подводит

ПроблемаКак проявляетсяЧто делать
МедленноОколо 26 токенов в секунду, ответ на большой запрос идёт минутамиДелить задачу на шаги, просить короткий формат
Передумывает простоеНа элементарный вопрос выдаёт развёрнутое рассуждениеПростые вопросы отдавать быстрой модели
Обрывы под нагрузкойПоток прекращается на середине ответаПовторить — бесплатно; не помогло — сменить модель
Нет техотчётаНеизвестно, на каких данных училась и где у неё слепые зоныПроверять результат так же, как у любой модели
Не понимает файлы напрямуюТолько текст, картинки и видеоКод вставлять текстом, для вложений брать Gemini
Слабые места на кодовых задачах

Главное ограничение: чей это код

Запросы к модели сохраняются на стороне разработчика, а разработчик не раскрыт. Для кода это означает конкретную границу.

Можно спокойноНе стоит
Открытые библиотеки и чужой публичный кодЗакрытый исходный код компании
Учебные и личные проектыКод, на который есть договор о неразглашении
Изолированные фрагменты без секретовФайлы конфигурации с ключами и паролями
Синтетические примеры для отладкиДампы с персональными данными пользователей
Публичная документацияВнутренние регламенты безопасности
Что можно грузить, а что нет

Как встроить её в свой процесс

  1. Разведка — на Ox Alpha. Понять чужой код, найти причину бага, собрать список мест для правки. Объёмно, бесплатно, ошибки не критичны.
  2. Черновик решения — на Ox Alpha. Первый вариант рефакторинга, набросок тестов.
  3. Финальная правка — на платной модели. То, что уйдёт в продакшн, лучше пропустить через модель с известным поставщиком.
  4. Всё закрытое — мимо превью. Без исключений.

Частые вопросы

Ox Alpha подходит для вайбкодинга?

Для вдумчивой части — да: разобрать, что получилось, найти ошибку, объяснить чужой код. Для быстрого перебора идей она медленновата, там удобнее быстрые модели. Про типичные грабли — в материале ошибки вайбкодинга.

Можно ли подключить Ox Alpha к своему редактору?

В СуперИнтеллекте модель работает в чате и в сценариях с агентами. Отдельного плагина для редактора нет, но задачи, ради которых обычно лезут в редактор — разбор проекта, поиск причины бага, набросок рефакторинга — закрываются прямо в диалоге, потому что весь проект помещается в контекст.

Что лучше для кода: Ox Alpha или Claude?

Claude предсказуемее и быстрее, за ним стоит известная компания — для ответственного кода он остаётся разумным выбором. Ox Alpha берут ради объёма и нулевой цены: разведка, черновики, массовые эксперименты. Подробное сопоставление — в сравнении моделей.