Inteligência artificial

ElevenLabs lança Eleven v4 e v4 Turbo com suporte a mais de 90 idiomas

A ElevenLabs anunciou os modelos de conversão de texto em fala Eleven v4 e Eleven v4 Turbo, com suporte a mais de 90 idiomas e clonagem de voz a partir de uma gravação de 10 segundos. A versão Turbo é voltada para aplicações de áudio em tempo real e agentes de inteligência artificial, com uma latência mediana de início da fala de cerca de 150 milissegundos, segundo testes da empresa.

2026-09-29
4 min de leitura
0 visualizações
certi.news
ElevenLabs lança Eleven v4 e v4 Turbo com suporte a mais de 90 idiomas

A ElevenLabs lançou os modelos de conversão de texto em fala Eleven v4 e Eleven v4 Turbo, em uma atualização que se concentra na melhoria da expressividade vocal, na consistência da identidade do falante e no suporte a aplicações que exigem resposta quase instantânea. Os dois modelos estão disponíveis por meio do ElevenAgents, ElevenCreative e ElevenAPI, com possibilidade de teste em contas gratuitas.

Maior controle sobre o tom e o contexto

A empresa afirma que o Eleven v4 se baseia em uma nova arquitetura capaz de interpretar o contexto, o tom, a velocidade da fala, a emoção e a personalidade ao produzir o áudio. O objetivo é preservar a identidade do falante em textos longos, alterando o estilo de apresentação de acordo com a natureza da cena, como um diálogo dramático, urgente, cômico ou cotidiano.

O modelo também pode utilizar as frases anteriores da conversa para ajustar o tom das frases seguintes. A ElevenLabs ampliou o sistema de marcadores de áudio que surgiu com o Eleven v3, permitindo agora combinar várias instruções dentro do pedido e aplicá-las em uma ordem específica. As instruções incluem exemplos como risada, raiva, um determinado sotaque, chuva leve e vibração de telefone. A empresa também anunciou melhorias no suporte ao Alfabeto Fonético Internacional (IPA) para ajudar na pronúncia de palavras e nomes próprios.

Clonagem de voz e suporte a idiomas

Segundo a ElevenLabs, o Eleven v4 consegue clonar uma voz a partir de uma gravação com duração de apenas 10 segundos. A empresa também reativou o recurso Professional Voice Clone com o novo modelo, depois de não tê-lo incluído no Eleven v3.

O Eleven v4 e o Eleven v4 Turbo oferecem suporte a mais de 90 idiomas, em comparação com cerca de 70 idiomas no Eleven v3. A empresa menciona melhorias específicas em japonês, português brasileiro, mandarim e cantonês, além da capacidade das vozes clonadas de falar outros idiomas com um sotaque local mais natural, segundo sua avaliação.

O que muda na prática com o v4 Turbo?

O Eleven v4 Turbo foi projetado para agentes de inteligência artificial de voz, centrais de atendimento e aplicações em tempo real diretamente afetadas pelo tempo de resposta. O modelo oferece transmissão bidirecional, permitindo iniciar a geração de áudio antes que a produção da frase seja concluída por inteiro.

Os testes da empresa indicam que a latência mediana para iniciar a saída de áudio é de cerca de 150 milissegundos, enquanto a latência mediana de inferência é de aproximadamente 100 milissegundos. Esses números continuam sendo resultados de testes realizados pela ElevenLabs, e não medições independentes. A empresa afirma que o modelo consegue começar a falar antes que a resposta do modelo de linguagem grande seja concluída, além de lidar por áudio com cenários como uma discussão durante a chamada, a transferência para outro atendente ou a colocação do interlocutor em espera.

Disponibilidade e limitações anunciadas

Os dois modelos podem ser usados por meio do ElevenAgents, ElevenCreative e ElevenAPI, e testados com contas gratuitas. O plano gratuito inclui 10 mil créditos mensais, enquanto os planos pagos começam em 6 dólares por mês. O Eleven v4 permite produzir até 10 mil caracteres em uma única operação, com ferramentas para conectar segmentos de áudio e preservar o ritmo e o tom em conteúdos longos, como audiolivros e podcasts.

A importância do anúncio está em reunir melhorias de expressividade multilíngue com um caminho separado para respostas de baixa latência, mas a qualidade efetiva dos resultados continuará relacionada ao idioma, à natureza do texto e ao tempo de resposta no ambiente de uso, além da necessidade de verificar a adequação da clonagem de vozes ao uso pretendido. A fonte não apresentou testes independentes que comparem diretamente os dois modelos com os concorrentes.

Fonte da notícia
c
Autor

certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias