Генерация аудио
Синтез речи, музыки и звука с помощью ИИ: новые модели, сервисы, клонирование голоса и связанные риски.
Suno добавила генерацию речи и фоновой музыки в одной дорожке
Speech доступна в публичной бета-версии на вебе и мобильных устройствах. Можно описать голос и сцену или задать текст; максимальная длительность — около восьми минут.
1 мин чтенияEleven v4 точнее следует подсказкам и сохраняет голос в длинных проектах
ElevenLabs выпустила Eleven v4 с управлением эмоциями, паузами и произношением, заявив о более стабильных голосах в длинных проектах. Версия Turbo начинает воспроизводить речь примерно за 150 мс; модель также поддерживает более 90 языков.
2 мин чтенияEngram превращает аудиосэмплы в экспериментальные звуки с помощью локальной AI-модели
Стартап Thoughtful Things запустил Kickstarter для автономного семплера и грувбокса. Устройство локально обрабатывает звук небольшой моделью; стартовый взнос начинается с 675 долларов.
2 мин чтенияSony и UMG подали новый иск к Suno из-за обучения модели v6
Sony и Universal Music Group утверждают, что новая музыкальная модель Suno v6 нарушает авторские права.
1 мин чтенияGoogle добавила в Gemini 3.8 Live говорящего аватара
Google представила Live Avatar — анимированного персонажа, который в реальном времени отвечает собеседнику: двигает губами в такт речи и меняет выражение лица.
2 мин чтенияGoogle представила две TTS-модели Gemini с генерацией голосов по текстовому описанию
Flash TTS создаёт голос с заданными ролью, акцентом и тембром; обе модели поддерживают более 100 языков и режиссёрские указания для отдельных реплик. Голосовой клон требует 30-секундный образец и записанное согласие владельца голоса.
2 мин чтенияTencent представила Gander — голосовую модель для беседы и фоновых задач
В исследовательской модели отдельные компоненты отвечают за разговор и сложные агентные действия. Gander принимает видео, речь и текст и позволяет перебивать себя, но тесты показывают компромисс между временем реакции и точностью выполнения задачи.
1 мин чтенияQwen3.8-Omni-Flash объединяет обработку аудио и видео и снижает цену API
Новая модель Qwen для ИИ-агентов принимает аудио и видео, имеет контекстное окно в миллион токенов и может вызывать инструменты. По сравнению с вводными тарифами Gemini 3.8 Flash её API стоит дешевле, однако сопоставление бенчмарков приводит сама Qwen.
2 мин чтенияxAI выпустила модель распознавания речи Grok Voice Transcribe 2.0
Компания заявляет, что новая версия вдвое точнее предшественницы при той же цене. В Artificial Analysis она заняла первое место среди 32 потоковых моделей.
2 мин чтенияGoogle выпустила Gemini 3.8 Live для голосовых агентов
Модели работают с голосом и визуальными данными и поддерживают более 97 языков. По тарифу Google час разговора обходится примерно в $1,38, но редакционная оценка отмечает преимущество конкурента в полно-дуплексном диалоге и естественности речи.
2 мин чтенияGoogle сообщает о поддержке более 300 языков и расширяет голосовой ИИ
Компания заявляет, что её технологии охватывают более 7 млрд человек, или 86% населения мира. Новые голосовые системы должны учитывать тон, паузы и смешение языков, но показатели охвата и качества приводятся самой Google.
2 мин чтенияElevenLabs выпустила Music v2.5 в приложении и API
Слепое сравнение охватило 47 885 пар композиций, а новая версия чаще получала предпочтение слушателей. Бесплатный тариф разрешает скачивать до пяти треков в день, Pro — до 400 в месяц.
1 мин чтенияOpenAI открыла разработчикам GPT-Live-1 для голосовых приложений
Модель принимает речь и отвечает одновременно, поддерживает вызовы инструментов и предлагает 12 голосов. Показатели тестов выше, чем у предшественника, но их приводит OpenAI; заявленная цена API — $0,05 за минуту.
1 мин чтенияUniversal Music и ElevenLabs создают платформу для ремиксов из лицензированных песен
Пользователи смогут делать ремиксы и новые версии треков из каталога Universal. Артисты будут сами решать, участвовать ли в проекте; условия использования музыки и сроки запуска пока не раскрыты.
1 мин чтенияSuno выпускает музыкальные модели v6 вместе с Warner, BMG и Believe
В новой линейке есть платные v6 и экспериментальная v6-wild, а также бесплатная v6-mini. Компания не раскрыла, какие каталоги использовались для обучения, и переводит сервис на новое поколение моделей.
2 мин чтенияPrime Video добавляет ИИ-синхронизацию губ для английского дубляжа
Функция подстраивает движения губ под переводную речь и пока работает на английской дорожке сериала «Макстон-холл». Prime Video уже включила её для первых двух сезонов по всему миру.
1 мин чтенияAdobe встроила генерацию видео и звука прямо в монтажную дорожку Premiere
Новый интерфейс Generative Media позволяет заполнять пустые участки таймлайна редактируемыми клипами и выбирать модели Adobe, Google, Runway, Luma или Kling. Инструменты разделения речи и помощник After Effects пока находятся в бете.
1 мин чтенияВсе материалы загружены

















