Все темыСюжет

Голосовые ассистенты

Голосовые ассистенты и разговорные интерфейсы: новые функции, устройства, качество распознавания и приватность.

Новости и разборыНайдено: 14
Инструменты

OpenAI запускает постоянных ИИ-помощников Dots для работы в приложениях

OpenAI запускает Dots — агентов на GPT-6 Astra с облачным компьютером и доступом к 4 000+ приложениям. Пользователи могут получать обновления, связываться голосом и задавать правила; запуск начался для Pro и Business Premium.

2 мин чтения
Инструменты

Gemini сможет звонить в местные компании от имени владельца Pixel 11

Эксперимент на Pixel 11 позволяет поручить ИИ запись, проверку наличия товара или перенос встречи. Пользователь видит расшифровку разговора и может вмешаться; доступ сначала ограничен платными подписчиками в США, участвующими в публичной бете Phone by Google.

1 мин чтения
Инструменты

Meta готовит Muse для умных очков и добавляет функции доступности

Meta сообщила, что работает над запуском Muse на умных очках: агент должен помогать с тренировками, записями о питании и покупками. Компания также объявила о функции усиления слуха, пространственном аудио, динамических фото и навигации.

2 мин чтения
Технологии

Meta показала носимое устройство Muse Charm для общения с ИИ-агентом

Устройство с экраном, датчиком отпечатка и камерой должно запускать Muse без телефона. Марк Цукерберг называет декабрьскую поставку целью, но компания пока изготовила лишь несколько прототипов и не раскрыла способ подключения к серверам.

1 мин чтения
Инструменты

Meta добавит Muse отдельные адреса почты, управление компьютером и видеозвонки

Агенты смогут переписываться по собственным адресам, а Muse на Mac получит доступ к компьютеру. Видеозвонки с аватаром и запуск на умных очках Meta пока описывает как планы на будущее.

1 мин чтения
Модели

Google представила две TTS-модели Gemini с генерацией голосов по текстовому описанию

Flash TTS создаёт голос с заданными ролью, акцентом и тембром; обе модели поддерживают более 100 языков и режиссёрские указания для отдельных реплик. Голосовой клон требует 30-секундный образец и записанное согласие владельца голоса.

2 мин чтения
Индустрия

Владельцы некоторых iPhone могут подать заявку на выплату по делу о Siri

Apple согласилась выплатить $250 млн для урегулирования коллективного иска о задержке обновлённой Siri. Жители США, купившие отдельные модели в период с 10 июня 2024 года по 29 марта 2025-го, могут получить ориентировочно $25–95 за устройство до 21 декабря 2026 года.

1 мин чтения
Модели

Tencent представила Gander — голосовую модель для беседы и фоновых задач

В исследовательской модели отдельные компоненты отвечают за разговор и сложные агентные действия. Gander принимает видео, речь и текст и позволяет перебивать себя, но тесты показывают компромисс между временем реакции и точностью выполнения задачи.

1 мин чтения
Модели

Google выпустила Gemini 3.8 Live для голосовых агентов

Модели работают с голосом и визуальными данными и поддерживают более 97 языков. По тарифу Google час разговора обходится примерно в $1,38, но редакционная оценка отмечает преимущество конкурента в полно-дуплексном диалоге и естественности речи.

2 мин чтения
Технологии

Google сообщает о поддержке более 300 языков и расширяет голосовой ИИ

Компания заявляет, что её технологии охватывают более 7 млрд человек, или 86% населения мира. Новые голосовые системы должны учитывать тон, паузы и смешение языков, но показатели охвата и качества приводятся самой Google.

2 мин чтения
Модели

Apple выпустила обновлённую Siri на моделях Google Gemini

Бета-версия ассистента понимает контекст сообщений, писем и экрана, но запущена только на английском и вне ЕС. Apple заявляет, что персональные данные не сохраняются.

2 мин чтения
Инструменты

OpenAI открыла разработчикам GPT-Live-1 для голосовых приложений

Модель принимает речь и отвечает одновременно, поддерживает вызовы инструментов и предлагает 12 голосов. Показатели тестов выше, чем у предшественника, но их приводит OpenAI; заявленная цена API — $0,05 за минуту.

1 мин чтения
Технологии

Apple объяснила, как обрабатывает аудио для новых функций Apple Watch

Компания утверждает, что исходный звук обрабатывается в изолированном блоке Secure Exclave в чипе S11 и не сохраняется аудиофайлом. Включение функций и сохранение текстовых результатов остаются под контролем пользователя.

2 мин чтения

Все материалы загружены