OpenAI открыла разработчикам GPT-Live-1 для голосовых приложений

Модель принимает речь и отвечает одновременно, поддерживает вызовы инструментов и предлагает 12 голосов. Показатели тестов выше, чем у предшественника, но их приводит OpenAI; заявленная цена API — $0,05 за минуту.

Речь на входе и выходе одновременно

OpenAI выпустила GPT-Live-1 в API для разработчиков голосовых приложений. Модель может одновременно слушать и говорить — режим называют full-duplex. Разработчики могут соединять её с разными серверными моделями, выбирая скорость, глубину рассуждений и стоимость под задачу. API также возвращает распознанный текст и текст ответа.

OpenAI предлагает 12 новых голосов с разными акцентами, диалектами и языками. Сервис бронирования Yelp применяет модель для телефонных резервов; улучшение обработки звонков описал технический директор компании Алекс Леви.

Результаты тестов и цена

В тестах OpenAI на полно-дуплексное взаимодействие GPT-Live-1 набрала 80,1% против 45,4% у GPT-Realtime-2.1. Задержка передачи очереди снизилась с 1,4 до 0,8 секунды, точность вызова инструментов выросла с 60% до 87%. В тесте голосовой поддержки банков доля успешно пройденных заданий составила 32% против 12,4% у предыдущей модели.

The Decoder приводит цену около $0,05 за минуту работы. Эти сравнения и результаты не являются независимым бенчмарком в статье; для подробностей OpenAI указывает документацию API.

The Decoder — OpenAI’s GPT-Live-1 API lets developers build apps that talk and listen at the same time