Qwen3.8-Omni-Flash объединяет обработку аудио и видео и снижает цену API

Новая модель Qwen для ИИ-агентов принимает аудио и видео, имеет контекстное окно в миллион токенов и может вызывать инструменты. По сравнению с вводными тарифами Gemini 3.8 Flash её API стоит дешевле, однако сопоставление бенчмарков приводит сама Qwen.

Модель рассчитана на мультимодальные задачи

Qwen3.8-Omni-Flash — первая мультимодальная модель Qwen, которую компания позиционирует для ИИ-агентов. Она обрабатывает звук и видео совместно, делает выводы и может самостоятельно использовать инструменты. Среди примеров применения — монтаж влогов, перевод коротких роликов и краткий пересказ фильмов.

Контекстное окно модели составляет один миллион токенов. Qwen заявляет, что в задачах с аудио и видео результат близок к Gemini 3.8 Flash. Это сравнение основано на заявлениях разработчика о мультимодальных бенчмарках, а не на независимой оценке в материале.

Тарифы API и примерная стоимость медиа

Опубликованные тарифы и оценки стоимости
ПоказательQwen3.8-Omni-FlashGemini 3.8 Flash
Вход, за 1 млн токенов$0,15$0,75 (вводная цена)
Выход, за 1 млн токенов$0,47$3,75 (вводная цена)
Оценка входного аудиоМенее $0,01 за часНе приведена
Видео 720p со звуком, 1 кадр/сОколо $0,20, без учёта ответаНе приведена

THE DECODER сообщает, что вводные цены Gemini должны удвоиться 1 января 2027 года. Оценки Qwen для аудио и видео не включают стоимость ответа модели, поэтому их нельзя напрямую сравнивать с полным расходом на запрос.

Доступ и дополнительные компоненты

Модель доступна через Qwen Studio, Qwen Cloud и API. Открытый набор Qwen-MM-Plugins добавляет функции видеомонтажа, распознавания говорящих, заметок к PDF-видео и повторно используемых сценариев для Claude Code, Gemini CLI и Qwen Code.

Qwen-Live Harness предназначен для взаимодействия в реальном времени через камеру и микрофон.

Qwen3.8-Omni-Flash undercuts Google's Gemini Flash pricing while matching its multimodal benchmarks