Искусственный интеллект

ElevenLabs запускает Eleven v4 и v4 Turbo с поддержкой более 90 языков

ElevenLabs объявила о выпуске моделей преобразования текста в речь Eleven v4 и Eleven v4 Turbo с поддержкой более 90 языков и клонированием голоса по записи длительностью 10 секунд. Версия Turbo предназначена для приложений с мгновенной передачей аудио и агентов искусственного интеллекта: согласно тестам компании, медианное время до начала вывода звука составляет около 150 миллисекунд.

2026-09-29
3 мин. чтения
0 просмотров
certi.news
ElevenLabs запускает Eleven v4 и v4 Turbo с поддержкой более 90 языков

ElevenLabs запустила две модели преобразования текста в речь — Eleven v4 и Eleven v4 Turbo — в рамках обновления, ориентированного на улучшение выразительности речи, согласованности личности говорящего и поддержку приложений, требующих почти мгновенного ответа. Обе модели доступны через ElevenAgents, ElevenCreative и ElevenAPI, а также могут быть опробованы с бесплатных аккаунтов.

Более широкий контроль над интонацией и контекстом

Компания утверждает, что Eleven v4 основана на новой архитектуре, способной учитывать контекст, интонацию, скорость речи, эмоциональность и характер при создании аудио. Это должно обеспечивать сохранение личности говорящего в длинных текстах и изменение манеры подачи в зависимости от характера сцены — например, драматического, срочного, комедийного или повседневного диалога.

Модель также может использовать предыдущие предложения в ходе разговора для настройки интонации последующих фраз. ElevenLabs расширила систему аудиотегов, представленную в Eleven v3: теперь в запрос можно добавлять несколько инструкций и применять их в определённом порядке. В качестве примеров инструкций компания приводит смех, гнев, определённый акцент, лёгкий дождь и вибрацию телефона. Компания также объявила об улучшенной поддержке Международного фонетического алфавита (IPA), которая помогает правильно произносить специальные слова и имена.

Клонирование голоса и поддержка языков

По данным ElevenLabs, Eleven v4 может клонировать голос по записи длительностью всего 10 секунд. Компания также вновь сделала доступной функцию Professional Voice Clone в новой модели, после того как она не поддерживалась в Eleven v3.

Eleven v4 и Eleven v4 Turbo поддерживают более 90 языков по сравнению примерно с 70 языками в Eleven v3. Компания отмечает особые улучшения в японском, бразильском португальском, мандаринском и кантонском языках, а также, согласно её оценке, более естественную способность голосовых копий говорить на других языках с местным акцентом.

Что на практике меняется с v4 Turbo?

Eleven v4 Turbo разработана для голосовых агентов искусственного интеллекта, колл-центров и приложений реального времени, на которые непосредственно влияет время отклика. Модель поддерживает двунаправленную потоковую передачу, что позволяет начать генерацию аудио до полного завершения создания предложения.

Согласно тестам компании, медианное время до начала вывода звука составляет около 150 миллисекунд, а медианное время вывода — около 100 миллисекунд. Эти показатели остаются результатами тестов, проведённых ElevenLabs, а не независимыми измерениями. Компания указывает, что модель может начать говорить до завершения ответа большой языковой модели, а также обрабатывать голосом такие сценарии, как конфликт во время звонка, перевод на другого оператора или перевод звонящего в режим ожидания.

Доступность и заявленные ограничения

Обе модели можно использовать через ElevenAgents, ElevenCreative и ElevenAPI, а также опробовать с бесплатных аккаунтов. Бесплатный тариф включает 10 тысяч кредитов в месяц, а стоимость платных тарифов начинается от 6 долларов в месяц. Eleven v4 поддерживает создание до 10 тысяч символов за одну операцию, а также инструменты для объединения аудиофрагментов и сохранения ритма и интонации в длинном контенте, например аудиокнигах и подкастах.

Значимость объявления заключается в объединении улучшений многоязычной выразительности с отдельным решением для обработки с низкой задержкой, однако фактическое качество результатов по-прежнему будет зависеть от языка, характера текста и времени отклика в конкретной среде использования, а также от необходимости проверить соответствие клонирования голосов предполагаемому применению. Источник не представил независимых тестов, напрямую сравнивающих обе модели с конкурентами.

Источник новости
c
Автор

certi.news

В той же категории

Вам также может понравиться

Все новости