Голосовые ассистенты
Голосовые ассистенты и разговорные интерфейсы: новые функции, устройства, качество распознавания и приватность.
OpenAI запускает постоянных ИИ-помощников Dots для работы в приложениях
OpenAI запускает Dots — агентов на GPT-6 Astra с облачным компьютером и доступом к 4 000+ приложениям. Пользователи могут получать обновления, связываться голосом и задавать правила; запуск начался для Pro и Business Premium.
2 мин чтенияGemini сможет звонить в местные компании от имени владельца Pixel 11
Эксперимент на Pixel 11 позволяет поручить ИИ запись, проверку наличия товара или перенос встречи. Пользователь видит расшифровку разговора и может вмешаться; доступ сначала ограничен платными подписчиками в США, участвующими в публичной бете Phone by Google.
1 мин чтенияMeta готовит Muse для умных очков и добавляет функции доступности
Meta сообщила, что работает над запуском Muse на умных очках: агент должен помогать с тренировками, записями о питании и покупками. Компания также объявила о функции усиления слуха, пространственном аудио, динамических фото и навигации.
2 мин чтенияMeta показала носимое устройство Muse Charm для общения с ИИ-агентом
Устройство с экраном, датчиком отпечатка и камерой должно запускать Muse без телефона. Марк Цукерберг называет декабрьскую поставку целью, но компания пока изготовила лишь несколько прототипов и не раскрыла способ подключения к серверам.
1 мин чтенияMeta добавит Muse отдельные адреса почты, управление компьютером и видеозвонки
Агенты смогут переписываться по собственным адресам, а Muse на Mac получит доступ к компьютеру. Видеозвонки с аватаром и запуск на умных очках Meta пока описывает как планы на будущее.
1 мин чтенияГолосовой режим ChatGPT получил доступ к почте, календарю и Slack
Голосовой режим ChatGPT теперь работает на моделях OpenAI GPT-6 Astra, Sol и Luna и впервые получил доступ к почте, календарю и Slack.
2 мин чтенияGoogle представила две TTS-модели Gemini с генерацией голосов по текстовому описанию
Flash TTS создаёт голос с заданными ролью, акцентом и тембром; обе модели поддерживают более 100 языков и режиссёрские указания для отдельных реплик. Голосовой клон требует 30-секундный образец и записанное согласие владельца голоса.
2 мин чтенияВладельцы некоторых iPhone могут подать заявку на выплату по делу о Siri
Apple согласилась выплатить $250 млн для урегулирования коллективного иска о задержке обновлённой Siri. Жители США, купившие отдельные модели в период с 10 июня 2024 года по 29 марта 2025-го, могут получить ориентировочно $25–95 за устройство до 21 декабря 2026 года.
1 мин чтенияTencent представила Gander — голосовую модель для беседы и фоновых задач
В исследовательской модели отдельные компоненты отвечают за разговор и сложные агентные действия. Gander принимает видео, речь и текст и позволяет перебивать себя, но тесты показывают компромисс между временем реакции и точностью выполнения задачи.
1 мин чтенияGoogle выпустила Gemini 3.8 Live для голосовых агентов
Модели работают с голосом и визуальными данными и поддерживают более 97 языков. По тарифу Google час разговора обходится примерно в $1,38, но редакционная оценка отмечает преимущество конкурента в полно-дуплексном диалоге и естественности речи.
2 мин чтенияGoogle сообщает о поддержке более 300 языков и расширяет голосовой ИИ
Компания заявляет, что её технологии охватывают более 7 млрд человек, или 86% населения мира. Новые голосовые системы должны учитывать тон, паузы и смешение языков, но показатели охвата и качества приводятся самой Google.
2 мин чтенияApple выпустила обновлённую Siri на моделях Google Gemini
Бета-версия ассистента понимает контекст сообщений, писем и экрана, но запущена только на английском и вне ЕС. Apple заявляет, что персональные данные не сохраняются.
2 мин чтенияOpenAI открыла разработчикам GPT-Live-1 для голосовых приложений
Модель принимает речь и отвечает одновременно, поддерживает вызовы инструментов и предлагает 12 голосов. Показатели тестов выше, чем у предшественника, но их приводит OpenAI; заявленная цена API — $0,05 за минуту.
1 мин чтенияApple объяснила, как обрабатывает аудио для новых функций Apple Watch
Компания утверждает, что исходный звук обрабатывается в изолированном блоке Secure Exclave в чипе S11 и не сохраняется аудиофайлом. Включение функций и сохранение текстовых результатов остаются под контролем пользователя.
2 мин чтенияВсе материалы загружены














