ElevenLabs lanzó los modelos de conversión de texto a voz Eleven v4 y Eleven v4 Turbo, en una actualización centrada en mejorar la expresividad vocal, la coherencia de la identidad del hablante y el soporte para aplicaciones que requieren una respuesta casi instantánea. Ambos modelos están disponibles a través de ElevenAgents, ElevenCreative y ElevenAPI, y se pueden probar desde cuentas gratuitas.
Mayor control sobre el tono y el contexto
La empresa afirma que Eleven v4 se basa en una nueva arquitectura capaz de interpretar el contexto, el tono, la velocidad del habla, la emoción y la personalidad al producir audio. El objetivo es mantener la identidad del hablante en textos largos, cambiando el estilo de declamación según la naturaleza de la escena, como un diálogo dramático, urgente, cómico o cotidiano.
El modelo también puede aprovechar las frases anteriores dentro de la conversación para ajustar el tono de las frases posteriores. ElevenLabs amplió el sistema de etiquetas de audio que apareció con Eleven v3, de modo que ahora es posible combinar varias instrucciones dentro de una solicitud y aplicarlas en un orden específico. Entre las instrucciones se incluyen ejemplos como reír, enfadarse, utilizar un acento determinado, lluvia ligera y vibración del teléfono. La empresa también anunció una mejora del soporte para el Alfabeto Fonético Internacional (IPA) con el fin de ayudar a pronunciar palabras y nombres propios.
Clonación de voz y compatibilidad lingüística
Según ElevenLabs, Eleven v4 puede clonar una voz a partir de una grabación de tan solo 10 segundos. La empresa también volvió a ofrecer la función Professional Voice Clone con el nuevo modelo, después de que no fuera compatible con Eleven v3.
Eleven v4 y Eleven v4 Turbo son compatibles con más de 90 idiomas, frente a unos 70 idiomas en Eleven v3. La empresa señala mejoras específicas en japonés, portugués brasileño, mandarín y cantonés, además de la capacidad de las voces clonadas para hablar otros idiomas con un acento local más natural, según su evaluación.
¿Qué cambia en la práctica con v4 Turbo?
Eleven v4 Turbo fue diseñado para agentes de inteligencia artificial de voz, centros de atención telefónica y aplicaciones en tiempo real directamente afectadas por la latencia. El modelo admite transmisión bidireccional, lo que permite comenzar a generar audio antes de que termine de producirse la frase completa.
Las pruebas de la empresa indican que la latencia mediana para comenzar a emitir audio es de aproximadamente 150 milisegundos, mientras que la latencia mediana de inferencia es de unos 100 milisegundos. Estas cifras siguen siendo resultados de pruebas realizadas por ElevenLabs y no mediciones independientes. La empresa señala que el modelo puede comenzar a hablar antes de que se complete la respuesta del modelo de lenguaje grande y que también gestiona por voz situaciones como una discusión durante la llamada, la transferencia a otro agente o poner al interlocutor en espera.
Disponibilidad y limitaciones anunciadas
Ambos modelos pueden utilizarse a través de ElevenAgents, ElevenCreative y ElevenAPI, y probarse mediante cuentas gratuitas. El plan gratuito incluye 10.000 créditos mensuales, mientras que los planes de pago comienzan en 6 dólares al mes. Eleven v4 admite producir hasta 10.000 caracteres en una sola operación, con herramientas para unir segmentos de audio y mantener el ritmo y el tono en contenidos largos como audiolibros y pódcast.
La importancia del anuncio reside en combinar mejoras de expresividad multilingüe con una vía independiente para ofrecer respuestas de baja latencia, pero la calidad real de los resultados seguirá estando relacionada con el idioma, la naturaleza del texto y el tiempo de respuesta en el entorno de uso, además de la necesidad de verificar la idoneidad de la clonación de voces para el uso previsto. La fuente no presentó pruebas independientes que compararan directamente ambos modelos con sus competidores.