Eleven v4 точнее следует подсказкам и сохраняет голос в длинных проектах

ElevenLabs выпустила Eleven v4 с управлением эмоциями, паузами и произношением, заявив о более стабильных голосах в длинных проектах. Версия Turbo начинает воспроизводить речь примерно за 150 мс; модель также поддерживает более 90 языков.

Модель лучше следует указаниям в тексте

Eleven v4 надёжнее выполняет подсказки для смеха, шёпота и звуков вроде хлопка двери. Пользователь может задавать эмоции, паузы и звуковые эффекты тегами или обычным текстом, а произношение имён и технических терминов уточнять фонетической записью.

Компания утверждает, что новая архитектура анализирует тон, темп и контекст сценария, чтобы сохранять одинаковый голос при повторной генерации отдельных реплик. В диалоге модель учитывает сцену целиком, а не только текущую фразу. Запрос может содержать до 10 000 символов — примерно десять минут аудио; более длинные произведения нужно делить на сегменты.

Eleven v4 поддерживает более 90 языков против примерно 70 у v3. Компания также вернула Professional Voice Clones; для Instant Voice Clone, по описанию издания, достаточно десяти секунд аудио.

Turbo рассчитана на разговор в реальном времени

Eleven v4 Turbo предназначена для голосовых агентов и других задач с низкой задержкой. По тестам ElevenLabs, первые слышимые слова появляются примерно через 150 мс; для сравнения компания приводит 262 мс у Cartesia Sonic 3.6 и 814 мс у OpenAI GPT-4o mini TTS.

Показатели качества приводит сама компания

В тесте произношения Eleven v4 набрала 91,7% против 85,6% у v3. В слепых тестах компании около трёх четвертей участников предпочли v4. Публикация также сообщает о более высоком месте модели в Provider Voice Arena, но отдельные тесты скорости и предпочтений выполнены или представлены ElevenLabs, поэтому они не являются независимой оценкой.

ElevenLabs' new v4 speech model makes AI voices more expressive and consistent