Что лучше: Haiku 5.5 или GPT-6 Luna?

В моих четырёх практических задачах Haiku 5.5 заметно лучше справилась с внешним видом сайтов и браузерной игрой. GPT-6 Luna выиграла исследование с PDF-отчётом и в трёх заданиях закончила основную работу быстрее. Но техническая оценка кода оказалась гораздо ближе, чем впечатления от результата: красивый интерфейс и надёжная программа — разные критерии.

4
практических задания для обеих моделей

Два сайта, PDF-отчёт и браузерная игра

3 из 4
результатов мне больше понравились у Haiku

Авторское впечатление, не общий рейтинг моделей

3 из 4
основных задач Luna завершила быстрее

Повторные попытки Haiku с игрой учитываем отдельно

Как сравнивались модели и что означают оценки

Поводом стал выпуск Haiku 5.5: в опубликованной Anthropic таблице она обходит Luna по нескольким тестам. Мне было интереснее проверить задачи, которые действительно бывают нужны: собрать лендинг по референсам, сделать сайт-визитку из резюме, исследовать тему и оформить PDF, написать небольшую игру. В каждой паре сохранялась суть задания, но отдельные указания различались: например, Luna в первом тесте дополнительно запретили использовать сабагентов. Это ещё одна причина не считать серию лабораторным сравнением.

Я оценивал то, что увидел и попробовал сам. Отдельно GPT-6 Astra проверила техническую сторону сайтов и игры, а в исследовании — качество самого отчёта. Эти оценки нельзя складывать в один средний балл: они отвечают на разные вопросы.

Оценки из выпуска, по десятибалльной шкале. Порядок задач совпадает с видео.
ЗадачаМоя оценка: Haiku / LunaОценка Astra: Haiku / Luna
Лендинг по референсам9 / около 58,2 / 8,2 — техника
Сайт-визитка8 / не выше 58,3 / 8,2 — техника
Исследование и PDFСогласен с оценкой Astra6,8 / 8,0 — качество отчёта
Браузерная игра9 / 47,8 / 7,2 — техника

Лендинг по референсам: одинаковый балл за код, разный визуал

Первое задание — лендинг компьютерного клуба по шести изображениям-референсам. На мой взгляд, Haiku лучше передала композицию и общий характер дизайна. Вариант Luna тоже узнаваем, но типографика, отступы и расстановка элементов понравились мне меньше: Haiku я поставил 9, Luna — примерно 5.

При этом Astra выставила обоим сайтам по 8,2 за техническую реализацию. Для читателя это полезная развилка: если задача — точно повторить визуальную идею, мой выбор в этом запуске Haiku; если смотреть только на устройство кода, убедительной разницы оценка не показала.

Сайт из резюме: внешний вид не гарантирует соблюдение задания

Во втором задании обе модели получили резюме и просьбу превратить его в сайт-визитку. Haiku снова понравилась мне больше по общему виду: 8 баллов против не выше 5 у Luna. Технические оценки почти совпали — 8,3 и 8,2.

Что пришлось проверить руками

Haiku 5.5

  • Визуально более удачный результат по моей оценке.
  • Оставила email, хотя в задании была просьба скрыть личные данные.

GPT-6 Luna

  • Техническая оценка почти такая же.
  • Потеряла часть карьерного опыта из исходного резюме.

Один сайт нужно было исправлять из-за лишних данных, другой — из-за пропусков. Перед публикацией такой страницы я бы сравнил её с резюме пункт за пунктом и отдельно проверил, что именно стало публичным. Само сообщение модели «готово» этого не доказывает.

Исследование с PDF: Luna лучше нашла данные, но ошиблась в арифметике

Для исследования о портативных игровых ПК требовалось собрать сведения и оформить их в PDF. Этот раунд я отдал Luna и согласился с оценкой Astra: 8,0 против 6,8 у Haiku. У Haiku были проблемы с подтверждением цен на дату среза, а Luna лучше нашла необходимые сведения.

Однако у Luna тоже нашлись ошибки, которые легко проверить без знания темы. Сравнение 80 и 50 в отчёте превратилось во «вдвое», хотя 80 / 50 = 1,6. Разница между 715 и 670 граммами была названа 75 граммами, хотя она составляет 45. Речь именно об арифметике по числам из созданного отчёта; сами характеристики устройств здесь заново не подтверждаются.

Браузерная игра: Haiku удивила результатом после долгого ожидания

Задание — небольшая браузерная игра про сервисного робота, который сбегает из датацентра. Модели сами выбирали механику, графику и звук. Luna сделала рабочую игру: можно двигаться, обходить дронов, взламывать карты доступа и стрелять. Я запустил её и немного поиграл, но результат впечатлил слабо — 4 балла.

Haiku с первого раза не справилась: были длинные ответы без готовой игры, прерывания и новые попытки. Я даже заменил робота и датацентр на обезьяну и зоопарк, но это не помогло. Успешная сессия началась примерно через час после первой попытки и снова использовала задание про датацентр. Причину задержек установить не удалось; версия о загрузке сервиса остаётся предположением.

Зато готовая игра Haiku мне понравилась гораздо больше — 9 баллов. В ней четыре уровня, история робота, назначенного на утилизацию, конусы обзора охраны, тревога и дроны. Здесь разница для меня была и в картинке, и в желании продолжать играть.

По технической проверке Astra разрыв скромнее: 7,8 против 7,2. Обе использовали Canvas, JavaScript и синтез звука в коде. У Haiku уровни, звук и отрисовка разнесены по файлам, у Luna многое собрано в одном. Ошибки есть у обеих: у Luna победа может смениться поражением в том же кадре, у Haiku погашенный импульсом снаряд всё ещё может нанести урон.

Сколько заняли задачи и как правильно читать стоимость

Приблизительное время основной задачи. В строке игры Haiku показана только удачная сессия; до неё был примерно час ожидания и повторных попыток.
ЗадачаHaiku 5.5GPT-6 Luna
Лендинг14:3810:57
Сайт-визитка3:4113:31
Исследование / PDF13:1610:24
Игра20:57 + около часа до удачной сессии13:42

Стоимость в выпуске сравнивается двумя разными способами. У Haiku записана оценка Cost из интерфейса Claude Code. Для Luna взяты счётчики токенов из журналов Codex и посчитан API-эквивалент по тарифу Standard. Это ориентир расхода, а не два сопоставимых счёта за подписку.

Доллары США, округление для чтения. Claude Code: показанная оценка; Codex: расчётный API-эквивалент, не фактическое списание.
ЗадачаHaiku: Cost в Claude CodeLuna: API Standard
Лендинг$1,06≈ $0,134
Сайт-визитка$0,24≈ $0,051
Исследование / PDF$1,20≈ $0,123
Игра$1,70≈ $0,120

Формальная сумма четырёх оценок Haiku — $4,20, сумма рассчитанных эквивалентов Luna — около $0,427. Из этих чисел нельзя заключить, что подписка на Haiku обойдётся ровно в десять раз дороже: состав учёта, повторные попытки, поиск и работа с кэшем различаются. В локальной проверке стоимость Haiku для PDF не сошлась полностью с интерфейсом.

Почему дешёвая Haiku стала дороже в Claude Code

У Haiku 5.5 цена зависит от длины одного запроса. По тарифам, проверенным 9 октября 2026 года, при промпте свыше 100 тысяч токенов ставки входа, выхода и кэша увеличиваются в пять раз. В агентской задаче важен не только ваш последний текст: к запросу добавляются история, инструкции, содержимое файлов и результаты инструментов.

Haiku 5.5: ставка за миллион выходных токенов
  • Промпт до 100k$0,50
  • Промпт свыше 100k$2,50

Официальный API-тариф Anthropic на дату проверки. Это ставка, а не стоимость целой задачи. Порог определяется размером входного промпта одного запроса.

В журналах этих запусков часто встречались запросы выше порога. Поэтому в длительной работе с кодом базовая цена модели плохо объясняет итоговую оценку Cost. Чтобы понять конкретный расход, нужно смотреть размер каждого запроса, категории токенов, поиск и повторные попытки. По официальной документации Claude Code, Session cost для пользователей Pro и Max — локальная оценка, а не счёт к оплате.

Какой вывод я сделал для своей работы

Выбор по результатам этого выпуска

Выберите задачу. Это вывод из конкретных запусков, а не гарантия следующего результата.

Сначала попробовал бы Haiku

В обоих сайтах мне больше понравился её результат. После генерации всё равно нужно проверить адаптивность, текст, скрытие личных данных и выполнение задания.

Что проверить в своём сравнении

0 из 5

Для меня Haiku оказалась приятным сюрпризом именно в визуальных задачах и игре. Но исследование выиграла Luna, а по качеству кода разрыв часто был небольшим. Полезнее выбирать помощника под свою задачу и проверять результат, чем переносить победу в одном выпуске на любую работу.