OpenAI открыла разработчикам GPT-Live-1 для голосовых приложений
Модель принимает речь и отвечает одновременно, поддерживает вызовы инструментов и предлагает 12 голосов. Показатели тестов выше, чем у предшественника, но их приводит OpenAI; заявленная цена API — $0,05 за минуту.
Речь на входе и выходе одновременно
OpenAI выпустила GPT-Live-1 в API для разработчиков голосовых приложений. Модель может одновременно слушать и говорить — режим называют full-duplex. Разработчики могут соединять её с разными серверными моделями, выбирая скорость, глубину рассуждений и стоимость под задачу. API также возвращает распознанный текст и текст ответа.
OpenAI предлагает 12 новых голосов с разными акцентами, диалектами и языками. Сервис бронирования Yelp применяет модель для телефонных резервов; улучшение обработки звонков описал технический директор компании Алекс Леви.
Результаты тестов и цена
В тестах OpenAI на полно-дуплексное взаимодействие GPT-Live-1 набрала 80,1% против 45,4% у GPT-Realtime-2.1. Задержка передачи очереди снизилась с 1,4 до 0,8 секунды, точность вызова инструментов выросла с 60% до 87%. В тесте голосовой поддержки банков доля успешно пройденных заданий составила 32% против 12,4% у предыдущей модели.
The Decoder приводит цену около $0,05 за минуту работы. Эти сравнения и результаты не являются независимым бенчмарком в статье; для подробностей OpenAI указывает документацию API.