A ElevenLabs lançou os modelos de conversão de texto em fala Eleven v4 e Eleven v4 Turbo, em uma atualização que se concentra na melhoria da expressividade vocal, na consistência da identidade do falante e no suporte a aplicações que exigem resposta quase instantânea. Os dois modelos estão disponíveis por meio do ElevenAgents, ElevenCreative e ElevenAPI, com possibilidade de teste em contas gratuitas.
Maior controle sobre o tom e o contexto
A empresa afirma que o Eleven v4 se baseia em uma nova arquitetura capaz de interpretar o contexto, o tom, a velocidade da fala, a emoção e a personalidade ao produzir o áudio. O objetivo é preservar a identidade do falante em textos longos, alterando o estilo de apresentação de acordo com a natureza da cena, como um diálogo dramático, urgente, cômico ou cotidiano.
O modelo também pode utilizar as frases anteriores da conversa para ajustar o tom das frases seguintes. A ElevenLabs ampliou o sistema de marcadores de áudio que surgiu com o Eleven v3, permitindo agora combinar várias instruções dentro do pedido e aplicá-las em uma ordem específica. As instruções incluem exemplos como risada, raiva, um determinado sotaque, chuva leve e vibração de telefone. A empresa também anunciou melhorias no suporte ao Alfabeto Fonético Internacional (IPA) para ajudar na pronúncia de palavras e nomes próprios.
Clonagem de voz e suporte a idiomas
Segundo a ElevenLabs, o Eleven v4 consegue clonar uma voz a partir de uma gravação com duração de apenas 10 segundos. A empresa também reativou o recurso Professional Voice Clone com o novo modelo, depois de não tê-lo incluído no Eleven v3.
O Eleven v4 e o Eleven v4 Turbo oferecem suporte a mais de 90 idiomas, em comparação com cerca de 70 idiomas no Eleven v3. A empresa menciona melhorias específicas em japonês, português brasileiro, mandarim e cantonês, além da capacidade das vozes clonadas de falar outros idiomas com um sotaque local mais natural, segundo sua avaliação.
O que muda na prática com o v4 Turbo?
O Eleven v4 Turbo foi projetado para agentes de inteligência artificial de voz, centrais de atendimento e aplicações em tempo real diretamente afetadas pelo tempo de resposta. O modelo oferece transmissão bidirecional, permitindo iniciar a geração de áudio antes que a produção da frase seja concluída por inteiro.
Os testes da empresa indicam que a latência mediana para iniciar a saída de áudio é de cerca de 150 milissegundos, enquanto a latência mediana de inferência é de aproximadamente 100 milissegundos. Esses números continuam sendo resultados de testes realizados pela ElevenLabs, e não medições independentes. A empresa afirma que o modelo consegue começar a falar antes que a resposta do modelo de linguagem grande seja concluída, além de lidar por áudio com cenários como uma discussão durante a chamada, a transferência para outro atendente ou a colocação do interlocutor em espera.
Disponibilidade e limitações anunciadas
Os dois modelos podem ser usados por meio do ElevenAgents, ElevenCreative e ElevenAPI, e testados com contas gratuitas. O plano gratuito inclui 10 mil créditos mensais, enquanto os planos pagos começam em 6 dólares por mês. O Eleven v4 permite produzir até 10 mil caracteres em uma única operação, com ferramentas para conectar segmentos de áudio e preservar o ritmo e o tom em conteúdos longos, como audiolivros e podcasts.
A importância do anúncio está em reunir melhorias de expressividade multilíngue com um caminho separado para respostas de baixa latência, mas a qualidade efetiva dos resultados continuará relacionada ao idioma, à natureza do texto e ao tempo de resposta no ambiente de uso, além da necessidade de verificar a adequação da clonagem de vozes ao uso pretendido. A fonte não apresentou testes independentes que comparem diretamente os dois modelos com os concorrentes.