ElevenLabs a lancé les modèles de synthèse vocale Eleven v4 et Eleven v4 Turbo, dans une mise à jour axée sur l’amélioration de l’expression vocale, la cohérence de l’identité du locuteur et la prise en charge des applications nécessitant une réponse quasi instantanée. Les deux modèles sont disponibles via ElevenAgents, ElevenCreative et ElevenAPI, et peuvent être essayés depuis les comptes gratuits.
Un contrôle accru du ton et du contexte
L’entreprise affirme qu’Eleven v4 repose sur une nouvelle architecture capable d’interpréter le contexte, le ton, la vitesse de parole, l’émotion et la personnalité lors de la production audio. L’objectif est de préserver l’identité du locuteur dans les textes longs, tout en adaptant le style de narration à la nature de la scène, qu’il s’agisse d’un dialogue dramatique, urgent, comique ou quotidien.
Le modèle peut également s’appuyer sur les phrases précédentes de la conversation pour ajuster le ton des phrases suivantes. ElevenLabs a élargi le système de balises vocales apparu avec Eleven v3 : il est désormais possible d’intégrer plusieurs instructions dans la requête et de les appliquer dans un ordre précis. Ces instructions comprennent notamment le rire, la colère, un accent particulier, une pluie légère et la vibration d’un téléphone. L’entreprise a également annoncé une meilleure prise en charge de l’alphabet phonétique international (API) afin d’aider à prononcer les mots et les noms propres.
Clonage vocal et prise en charge des langues
Selon ElevenLabs, Eleven v4 peut cloner une voix à partir d’un enregistrement ne dépassant pas 10 secondes. L’entreprise a également réactivé la fonctionnalité Professional Voice Clone avec le nouveau modèle, après ne pas l’avoir prise en charge dans Eleven v3.
Eleven v4 et Eleven v4 Turbo prennent en charge plus de 90 langues, contre environ 70 langues pour Eleven v3. L’entreprise mentionne une amélioration particulière en japonais, en portugais brésilien, en mandarin et en cantonais, ainsi que la capacité des voix clonées à parler d’autres langues avec un accent local plus naturel, selon son évaluation.
Qu’est-ce qui change concrètement avec v4 Turbo ?
Eleven v4 Turbo a été conçu pour les agents vocaux d’intelligence artificielle, les centres d’appels et les applications instantanées directement affectées par le temps de réponse. Le modèle prend en charge le streaming bidirectionnel, ce qui permet de commencer à générer l’audio avant que la production complète de la phrase ne soit terminée.
Les tests de l’entreprise indiquent que la latence médiane de démarrage de la sortie audio est d’environ 150 millisecondes, tandis que la latence médiane d’inférence est d’environ 100 millisecondes. Ces chiffres restent les résultats de tests menés par ElevenLabs et non des mesures indépendantes. L’entreprise indique que le modèle peut commencer à parler avant que la réponse du grand modèle de langage ne soit terminée, et qu’il gère également vocalement des scénarios tels qu’un désaccord pendant l’appel, le transfert vers un autre agent ou la mise de l’appelant en attente.
Disponibilité et limites annoncées
Les deux modèles peuvent être utilisés via ElevenAgents, ElevenCreative et ElevenAPI, et essayés avec des comptes gratuits. Le forfait gratuit comprend 10 000 crédits par mois, tandis que les forfaits payants commencent à 6 dollars par mois. Eleven v4 prend en charge la production de jusqu’à 10 000 caractères par opération, avec des outils permettant de relier les segments audio et de préserver le rythme et le ton dans les contenus longs tels que les livres audio et les podcasts.
L’importance de cette annonce réside dans la combinaison d’améliorations de l’expression multilingue et d’une voie distincte dédiée aux réponses à faible latence. Toutefois, la qualité réelle des résultats restera liée à la langue, à la nature du texte et au temps de réponse dans l’environnement d’utilisation, en plus de la nécessité de vérifier l’adéquation du clonage vocal à l’usage prévu. La source n’a pas fourni de tests indépendants comparant directement les deux modèles à leurs concurrents.