Tencent представила Gander — голосовую модель для беседы и фоновых задач

В исследовательской модели отдельные компоненты отвечают за разговор и сложные агентные действия. Gander принимает видео, речь и текст и позволяет перебивать себя, но тесты показывают компромисс между временем реакции и точностью выполнения задачи.

Пока пользователь говорит, агент может продолжать работу

Исследователи команды Hunyuan Speech в Tencent вместе с несколькими университетами представили Gander — модель для одновременной работы с речью, изображениями и текстом. Она рассчитана на живой разговор и более сложные действия как агент: может задавать уточняющие вопросы, сообщать о ходе работы и принимать перебивания пользователя.

Авторы противопоставляют такой режим обычным голосовым помощникам, которые поочерёдно слушают и отвечают. В примерах Gander может обсуждать экран, ждать появления нужного слайда или исправлять программную ошибку, не прекращая общение.

Компоненты можно менять, но паузы влияют на точность

Архитектура разделяет «мозжечок», который поддерживает непрерывный диалог, и сменяемый «мозг» для сложных задач. Это позволяет менять агентную часть без полной перестройки голосового взаимодействия. При этом в тестах более частые разговорные ходы конкурировали с вычислениями для задачи: задержки для ответа и качество агентного результата требовали компромисса.

Работа остаётся исследовательской системой, а не описанием общедоступного коммерческого продукта. Результаты и код изложены авторами технического отчёта; публикация не показывает сравнения с независимым пользовательским тестом в обычных условиях эксплуатации.

The Decoder — Tencent's Gander aims to keep talking while it works in the background