Haiku 5.5 против GPT-6 Luna: сравнение на четырёх реальных задачах
Сайты, браузерная игра и исследование с PDF: где Haiku 5.5 оказалась сильнее GPT-6 Luna, сколько заняли задачи и почему оценка стоимости в Claude Code выросла.
Что лучше: Haiku 5.5 или GPT-6 Luna?
В моих четырёх практических задачах Haiku 5.5 заметно лучше справилась с внешним видом сайтов и браузерной игрой. GPT-6 Luna выиграла исследование с PDF-отчётом и в трёх заданиях закончила основную работу быстрее. Но техническая оценка кода оказалась гораздо ближе, чем впечатления от результата: красивый интерфейс и надёжная программа — разные критерии.
- 4
- практических задания для обеих моделей
- 3 из 4
- результатов мне больше понравились у Haiku
- 3 из 4
- основных задач Luna завершила быстрее
Два сайта, PDF-отчёт и браузерная игра
Авторское впечатление, не общий рейтинг моделей
Повторные попытки Haiku с игрой учитываем отдельно
Как сравнивались модели и что означают оценки
Поводом стал выпуск Haiku 5.5: в опубликованной Anthropic таблице она обходит Luna по нескольким тестам. Мне было интереснее проверить задачи, которые действительно бывают нужны: собрать лендинг по референсам, сделать сайт-визитку из резюме, исследовать тему и оформить PDF, написать небольшую игру. В каждой паре сохранялась суть задания, но отдельные указания различались: например, Luna в первом тесте дополнительно запретили использовать сабагентов. Это ещё одна причина не считать серию лабораторным сравнением.
Я оценивал то, что увидел и попробовал сам. Отдельно GPT-6 Astra проверила техническую сторону сайтов и игры, а в исследовании — качество самого отчёта. Эти оценки нельзя складывать в один средний балл: они отвечают на разные вопросы.
| Задача | Моя оценка: Haiku / Luna | Оценка Astra: Haiku / Luna |
|---|---|---|
| Лендинг по референсам | 9 / около 5 | 8,2 / 8,2 — техника |
| Сайт-визитка | 8 / не выше 5 | 8,3 / 8,2 — техника |
| Исследование и PDF | Согласен с оценкой Astra | 6,8 / 8,0 — качество отчёта |
| Браузерная игра | 9 / 4 | 7,8 / 7,2 — техника |
Лендинг по референсам: одинаковый балл за код, разный визуал
Первое задание — лендинг компьютерного клуба по шести изображениям-референсам. На мой взгляд, Haiku лучше передала композицию и общий характер дизайна. Вариант Luna тоже узнаваем, но типографика, отступы и расстановка элементов понравились мне меньше: Haiku я поставил 9, Luna — примерно 5.

При этом Astra выставила обоим сайтам по 8,2 за техническую реализацию. Для читателя это полезная развилка: если задача — точно повторить визуальную идею, мой выбор в этом запуске Haiku; если смотреть только на устройство кода, убедительной разницы оценка не показала.
Сайт из резюме: внешний вид не гарантирует соблюдение задания
Во втором задании обе модели получили резюме и просьбу превратить его в сайт-визитку. Haiku снова понравилась мне больше по общему виду: 8 баллов против не выше 5 у Luna. Технические оценки почти совпали — 8,3 и 8,2.
Что пришлось проверить руками
Haiku 5.5
- Визуально более удачный результат по моей оценке.
- Оставила email, хотя в задании была просьба скрыть личные данные.
GPT-6 Luna
- Техническая оценка почти такая же.
- Потеряла часть карьерного опыта из исходного резюме.
Один сайт нужно было исправлять из-за лишних данных, другой — из-за пропусков. Перед публикацией такой страницы я бы сравнил её с резюме пункт за пунктом и отдельно проверил, что именно стало публичным. Само сообщение модели «готово» этого не доказывает.
Исследование с PDF: Luna лучше нашла данные, но ошиблась в арифметике
Для исследования о портативных игровых ПК требовалось собрать сведения и оформить их в PDF. Этот раунд я отдал Luna и согласился с оценкой Astra: 8,0 против 6,8 у Haiku. У Haiku были проблемы с подтверждением цен на дату среза, а Luna лучше нашла необходимые сведения.
Однако у Luna тоже нашлись ошибки, которые легко проверить без знания темы. Сравнение 80 и 50 в отчёте превратилось во «вдвое», хотя 80 / 50 = 1,6. Разница между 715 и 670 граммами была названа 75 граммами, хотя она составляет 45. Речь именно об арифметике по числам из созданного отчёта; сами характеристики устройств здесь заново не подтверждаются.
Браузерная игра: Haiku удивила результатом после долгого ожидания
Задание — небольшая браузерная игра про сервисного робота, который сбегает из датацентра. Модели сами выбирали механику, графику и звук. Luna сделала рабочую игру: можно двигаться, обходить дронов, взламывать карты доступа и стрелять. Я запустил её и немного поиграл, но результат впечатлил слабо — 4 балла.
Haiku с первого раза не справилась: были длинные ответы без готовой игры, прерывания и новые попытки. Я даже заменил робота и датацентр на обезьяну и зоопарк, но это не помогло. Успешная сессия началась примерно через час после первой попытки и снова использовала задание про датацентр. Причину задержек установить не удалось; версия о загрузке сервиса остаётся предположением.
Зато готовая игра Haiku мне понравилась гораздо больше — 9 баллов. В ней четыре уровня, история робота, назначенного на утилизацию, конусы обзора охраны, тревога и дроны. Здесь разница для меня была и в картинке, и в желании продолжать играть.
По технической проверке Astra разрыв скромнее: 7,8 против 7,2. Обе использовали Canvas, JavaScript и синтез звука в коде. У Haiku уровни, звук и отрисовка разнесены по файлам, у Luna многое собрано в одном. Ошибки есть у обеих: у Luna победа может смениться поражением в том же кадре, у Haiku погашенный импульсом снаряд всё ещё может нанести урон.
Сколько заняли задачи и как правильно читать стоимость
| Задача | Haiku 5.5 | GPT-6 Luna |
|---|---|---|
| Лендинг | 14:38 | 10:57 |
| Сайт-визитка | 3:41 | 13:31 |
| Исследование / PDF | 13:16 | 10:24 |
| Игра | 20:57 + около часа до удачной сессии | 13:42 |
Стоимость в выпуске сравнивается двумя разными способами. У Haiku записана оценка Cost из интерфейса Claude Code. Для Luna взяты счётчики токенов из журналов Codex и посчитан API-эквивалент по тарифу Standard. Это ориентир расхода, а не два сопоставимых счёта за подписку.
| Задача | Haiku: Cost в Claude Code | Luna: API Standard |
|---|---|---|
| Лендинг | $1,06 | ≈ $0,134 |
| Сайт-визитка | $0,24 | ≈ $0,051 |
| Исследование / PDF | $1,20 | ≈ $0,123 |
| Игра | $1,70 | ≈ $0,120 |
Формальная сумма четырёх оценок Haiku — $4,20, сумма рассчитанных эквивалентов Luna — около $0,427. Из этих чисел нельзя заключить, что подписка на Haiku обойдётся ровно в десять раз дороже: состав учёта, повторные попытки, поиск и работа с кэшем различаются. В локальной проверке стоимость Haiku для PDF не сошлась полностью с интерфейсом.
Почему дешёвая Haiku стала дороже в Claude Code
У Haiku 5.5 цена зависит от длины одного запроса. По тарифам, проверенным 9 октября 2026 года, при промпте свыше 100 тысяч токенов ставки входа, выхода и кэша увеличиваются в пять раз. В агентской задаче важен не только ваш последний текст: к запросу добавляются история, инструкции, содержимое файлов и результаты инструментов.
Официальный API-тариф Anthropic на дату проверки. Это ставка, а не стоимость целой задачи. Порог определяется размером входного промпта одного запроса.
В журналах этих запусков часто встречались запросы выше порога. Поэтому в длительной работе с кодом базовая цена модели плохо объясняет итоговую оценку Cost. Чтобы понять конкретный расход, нужно смотреть размер каждого запроса, категории токенов, поиск и повторные попытки. По официальной документации Claude Code, Session cost для пользователей Pro и Max — локальная оценка, а не счёт к оплате.
Какой вывод я сделал для своей работы
Выбор по результатам этого выпуска
Выберите задачу. Это вывод из конкретных запусков, а не гарантия следующего результата.
В обоих сайтах мне больше понравился её результат. После генерации всё равно нужно проверить адаптивность, текст, скрытие личных данных и выполнение задания.
Она лучше собрала сведения, но допустила простые арифметические ошибки. Каждый существенный вывод требует ссылки и ручной сверки.
Мне больше понравились игра и визуал. Однако повторные попытки заняли около часа до начала удачной сессии, а технические ошибки остались у обеих моделей.
В этой серии расчётный API-эквивалент Luna был ниже. Для реального выбора подписки нужны собственные измерения лимитов, времени ожидания, проверок и доработок.
Что проверить в своём сравнении
0 из 5Для меня Haiku оказалась приятным сюрпризом именно в визуальных задачах и игре. Но исследование выиграла Luna, а по качеству кода разрыв часто был небольшим. Полезнее выбирать помощника под свою задачу и проверять результат, чем переносить победу в одном выпуске на любую работу.
Источники
Продолжить чтение
В ленте материалов: 1