Google выпустила Gemini 3.8 Live для голосовых агентов

Модели работают с голосом и визуальными данными и поддерживают более 97 языков. По тарифу Google час разговора обходится примерно в $1,38, но редакционная оценка отмечает преимущество конкурента в полно-дуплексном диалоге и естественности речи.

Голосовой агент может говорить и работать с инструментами

Google DeepMind представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — аудиомодели для разработчиков, доступные через Gemini API и Google AI Studio. Базовая версия может запускать API-вызовы в фоне, обрабатывать визуальный ввод и продолжать разговор. Google заявляет поддержку более 97 языков.

Extended Thinking получила 82,6% и первое место на Speech-to-Speech Leaderboard Artificial Analysis на момент публикации The Decoder. Это результат конкретной сравнительной таблицы, а не универсальная оценка качества диалога. Примеры приложений и документация доступны разработчикам через Gemini API.

Голосовой API дешевле, но сравнение затрагивает и качество

Google указывает цену 0,005 доллара за минуту входного аудио и 0,018 доллара за минуту выходного; в примере The Decoder час разговора стоит около 1,38 доллара. Для GPT-Live-1 в публикации приводится ставка 0,05 доллара за минуту и оценка не менее 3 долларов за час. Это расчёты для разных тарифных моделей и потока речи, поэтому конкретный счёт будет зависеть от продолжительности ввода и генерации.

The Decoder отмечает, что GPT-Live-1 поддерживает полно-дуплексный режим, когда система одновременно слушает и говорит, и по демонстрациям звучит естественнее. Следовательно, разница в стоимости не показывает сама по себе, какая модель лучше подходит для конкретного агента: важны тариф, задержка, возможность перебивания и качество ответа. Сравнение по естественности в статье основано на прослушивании демо, а не на формальном тесте.

The Decoder — Google launches Gemini 3.8 Live to take on OpenAI's GPT-Live-1 at a fraction of the cost