GPT-6 Luna — единственная чужая модель, которую Anthropic поставила в одну таблицу с Haiku 5.5 в анонсе 7 октября 2026 года. Независимый разбор того же дня опубликовал Artificial Analysis. Цифры ниже разделены по источнику: прогоны разные, и числа не обязаны совпасть.

Таблица Anthropic

ТестHaiku 5.5GPT-6 Luna
GDPval-AA v2.116201437
AA-Briefcase v1.115781336
OSWorld 2.1, офлайн72,4%48,9%
Terminal-Bench 4.039,2%16,4%
FrontierCode 1.1 (Main)46,4%42,4%
Chartography, без инструментов46,4%29,1%
Анонс Claude Haiku 5.5. Humanity’s Last Exam для Luna Anthropic не приводит

Самый заметный разрыв — работа в терминале и за компьютером. На FrontierCode отрыв небольшой: 46,4% против 42,4%. Sonnet 5.5 в той же таблице Anthropic всё равно выше обеих, особенно на Terminal-Bench (70,6%). Когда брать Sonnet или Opus, разобрано в гайде Haiku, Sonnet и Opus.

Что добавляет Artificial Analysis

  • Индекс интеллекта, максимальное усилие. Haiku 5.5 — 43, GPT-6 Luna — 38. Это сводная оценка, не один тест.
  • Тот же индекс на высоком, не максимальном усилии. Haiku на ступени high набирает 38 — столько же, сколько Luna на max. Дальше, от xhigh к max, Haiku прибавляет около 2 пунктов.
  • Длина ответа на задачу индекса. На max Haiku пишет около 162 тысяч выходных токенов на задачу, Luna — около 50 тысяч. Haiku на high — около 55 тысяч при тех же 38 пунктах индекса, что у Luna на max.
  • Факты. Точность AA-Omniscience: 36% у Haiku и 44% у Luna. Доля галлюцинаций при этом ниже у Haiku: 40% против 77%. Haiku чаще говорит, что не знает.
  • Свой прогон Terminal-Bench 4.0. У Artificial Analysis 33% у Haiku и 13% у Luna. Это не те 39,2% и 16,4%, что в анонсе: другой прогон, порядок тот же.

Как выбрать

  1. Нужен короткий ответ на повторяемый вопрос, и важнее не выдумать факт — смотрите на готовность Haiku признать незнание, но сверяйте факты: по точности знаний Luna в замере AA выше.
  2. Нужно действие за компьютером, разбор графика или офисная задача из таблицы Anthropic — в их замере впереди Haiku.
  3. Ответ раздувается и уходит в длинные рассуждения — снизьте усилие Haiku или возьмите Luna. На максимальной ступени Haiku пишет заметно больше.

Обе модели переключаются в одном чате. Сравнение с Gemini — в гайде Haiku 5.5 и Gemini 3.8 Flash.


Открыть чат в SUIN.AI — Haiku 5.5, GPT-6 Luna, Gemini 3.8 Flash, GLM и Kimi выбираются в одном списке.