Все темыСюжет

Генерация аудио

Синтез речи, музыки и звука с помощью ИИ: новые модели, сервисы, клонирование голоса и связанные риски.

Новости и разборыНайдено: 17
Инструменты

Eleven v4 точнее следует подсказкам и сохраняет голос в длинных проектах

ElevenLabs выпустила Eleven v4 с управлением эмоциями, паузами и произношением, заявив о более стабильных голосах в длинных проектах. Версия Turbo начинает воспроизводить речь примерно за 150 мс; модель также поддерживает более 90 языков.

2 мин чтения
Инструменты

Engram превращает аудиосэмплы в экспериментальные звуки с помощью локальной AI-модели

Стартап Thoughtful Things запустил Kickstarter для автономного семплера и грувбокса. Устройство локально обрабатывает звук небольшой моделью; стартовый взнос начинается с 675 долларов.

2 мин чтения
Модели

Google добавила в Gemini 3.8 Live говорящего аватара

Google представила Live Avatar — анимированного персонажа, который в реальном времени отвечает собеседнику: двигает губами в такт речи и меняет выражение лица.

2 мин чтения
Модели

Google представила две TTS-модели Gemini с генерацией голосов по текстовому описанию

Flash TTS создаёт голос с заданными ролью, акцентом и тембром; обе модели поддерживают более 100 языков и режиссёрские указания для отдельных реплик. Голосовой клон требует 30-секундный образец и записанное согласие владельца голоса.

2 мин чтения
Модели

Tencent представила Gander — голосовую модель для беседы и фоновых задач

В исследовательской модели отдельные компоненты отвечают за разговор и сложные агентные действия. Gander принимает видео, речь и текст и позволяет перебивать себя, но тесты показывают компромисс между временем реакции и точностью выполнения задачи.

1 мин чтения
Модели

Qwen3.8-Omni-Flash объединяет обработку аудио и видео и снижает цену API

Новая модель Qwen для ИИ-агентов принимает аудио и видео, имеет контекстное окно в миллион токенов и может вызывать инструменты. По сравнению с вводными тарифами Gemini 3.8 Flash её API стоит дешевле, однако сопоставление бенчмарков приводит сама Qwen.

2 мин чтения
Модели

Google выпустила Gemini 3.8 Live для голосовых агентов

Модели работают с голосом и визуальными данными и поддерживают более 97 языков. По тарифу Google час разговора обходится примерно в $1,38, но редакционная оценка отмечает преимущество конкурента в полно-дуплексном диалоге и естественности речи.

2 мин чтения
Технологии

Google сообщает о поддержке более 300 языков и расширяет голосовой ИИ

Компания заявляет, что её технологии охватывают более 7 млрд человек, или 86% населения мира. Новые голосовые системы должны учитывать тон, паузы и смешение языков, но показатели охвата и качества приводятся самой Google.

2 мин чтения
Модели

ElevenLabs выпустила Music v2.5 в приложении и API

Слепое сравнение охватило 47 885 пар композиций, а новая версия чаще получала предпочтение слушателей. Бесплатный тариф разрешает скачивать до пяти треков в день, Pro — до 400 в месяц.

1 мин чтения
Инструменты

OpenAI открыла разработчикам GPT-Live-1 для голосовых приложений

Модель принимает речь и отвечает одновременно, поддерживает вызовы инструментов и предлагает 12 голосов. Показатели тестов выше, чем у предшественника, но их приводит OpenAI; заявленная цена API — $0,05 за минуту.

1 мин чтения
Индустрия

Universal Music и ElevenLabs создают платформу для ремиксов из лицензированных песен

Пользователи смогут делать ремиксы и новые версии треков из каталога Universal. Артисты будут сами решать, участвовать ли в проекте; условия использования музыки и сроки запуска пока не раскрыты.

1 мин чтения
Модели

Suno выпускает музыкальные модели v6 вместе с Warner, BMG и Believe

В новой линейке есть платные v6 и экспериментальная v6-wild, а также бесплатная v6-mini. Компания не раскрыла, какие каталоги использовались для обучения, и переводит сервис на новое поколение моделей.

2 мин чтения
Технологии

Prime Video добавляет ИИ-синхронизацию губ для английского дубляжа

Функция подстраивает движения губ под переводную речь и пока работает на английской дорожке сериала «Макстон-холл». Prime Video уже включила её для первых двух сезонов по всему миру.

1 мин чтения
Инструменты

Adobe встроила генерацию видео и звука прямо в монтажную дорожку Premiere

Новый интерфейс Generative Media позволяет заполнять пустые участки таймлайна редактируемыми клипами и выбирать модели Adobe, Google, Runway, Luma или Kling. Инструменты разделения речи и помощник After Effects пока находятся в бете.

1 мин чтения

Все материалы загружены