OpenArt запустила рейтинги ИИ-моделей по конкретным творческим задачам
Arena оценивает модели для кино, дизайна, рекламы, электронной торговли и видеомонтажа через слепые парные сравнения. Seedance 2.5 лидирует на большинстве видеопанелей, но число судей и голосов OpenArt пока не раскрыла.
От рейтинга модели — к рейтингу задачи
OpenArt представила публичную Arena для моделей генерации изображений и видео. Вместо единого балла компания разделяет таблицы по применению: кино, анимация, графический дизайн, реклама, электронная торговля, видеомонтаж, motion design и lip sync. Критерии должны соответствовать работе: например, для кино важны движение камеры и освещение, а для рекламы — читаемый текст и точность логотипа.
Модели сравнивают вслепую по парам: эксперты выбирают лучший результат, а затем предпочтения сводятся статистической моделью Bradley–Terry. OpenArt сообщила о плане набрать 800–1 000 «tastemakers», но это предполагаемый пул, а не число людей, завершивших оценивание. Компания не раскрыла количество голосов и промптов в стартовых рейтингах.
Seedance 2.5 лидирует не во всех категориях
В стартовой общей таблице видео Seedance 2.5 получила 1 081 балл, Wan 3.0 — 1 004, Seedance 2.0 — 1 000. Seedance 2.5 возглавила четыре из пяти предоставленных видеопанелей, включая кино, motion design и lip sync. В видеомонтаже первой стала Wan 3.0 с 1 034 баллами, а Seedance 2.5 получила 1 033. OpenArt показывает 95-процентные интервалы доверия, поэтому разрыв в один балл не следует считать доказательством заметно лучшего качества.
В рейтингах изображений лидерство разделилось между моделями: GPT Image 2 оказалась первой в графическом дизайне, Seedream 5.0 Pro — в кино и электронной торговле. Результаты полезнее трактовать как карту сильных сторон, чем как постоянный общий рейтинг: модели быстро обновляются, а лучшие варианты зависят от конкретного задания.
Ограничения первых таблиц
Часть активных промптов OpenArt оставляет закрытой, чтобы разработчики не настраивали модели специально под тест; часть методики и наборов компания обещает публиковать. Это снижает риск «натаскивания», но без числа оценщиков, голосов и заданий читателям трудно понять, сколько данных лежит за отдельным рейтингом.
Для команд Arena — дополнительный сигнал при выборе модели. Перед закупкой её стоит сопоставлять с собственными задачами: точностью упаковки и текста, движением камеры, редактированием видео и условиями развёртывания.