Künstliche Intelligenz

ElevenLabs bringt Eleven v4 und v4 Turbo mit Unterstützung für mehr als 90 Sprachen auf den Markt

ElevenLabs hat die Text-zu-Sprache-Modelle Eleven v4 und Eleven v4 Turbo angekündigt, die mehr als 90 Sprachen unterstützen und das Klonen einer Stimme aus einer 10 Sekunden langen Aufnahme ermöglichen. Die Turbo-Version richtet sich an Echtzeit-Audioanwendungen und KI-Agenten mit einer laut Unternehmenstests mittleren Zeit bis zum Beginn der Sprachausgabe von etwa 150 Millisekunden.

2026-09-29
4 Min. Lesezeit
0 Aufrufe
certi.news
ElevenLabs bringt Eleven v4 und v4 Turbo mit Unterstützung für mehr als 90 Sprachen auf den Markt

ElevenLabs hat die Text-zu-Sprache-Modelle Eleven v4 und Eleven v4 Turbo auf den Markt gebracht. Das Update konzentriert sich auf eine ausdrucksstärkere Sprachausgabe, eine konsistente Sprecheridentität und die Unterstützung von Anwendungen, die eine nahezu sofortige Reaktion erfordern. Beide Modelle sind über ElevenAgents, ElevenCreative und ElevenAPI verfügbar und können mit kostenlosen Konten ausprobiert werden.

Mehr Kontrolle über Tonfall und Kontext

Nach Angaben des Unternehmens basiert Eleven v4 auf einer neuen Architektur, die bei der Spracherzeugung Kontext, Tonfall, Sprechgeschwindigkeit, Emotion und Persönlichkeit interpretieren kann. Dadurch soll die Identität des Sprechers in längeren Texten erhalten bleiben, während sich die Vortragsweise je nach Art der Szene verändert, etwa bei einem dramatischen, dringenden, komödiantischen oder alltäglichen Dialog.

Das Modell kann außerdem die vorherigen Sätze innerhalb eines Gesprächs nutzen, um den Tonfall der folgenden Sätze anzupassen. ElevenLabs hat das mit Eleven v3 eingeführte System für Audio-Tags erweitert, sodass nun mehrere Anweisungen innerhalb einer Anfrage kombiniert und in einer bestimmten Reihenfolge angewendet werden können. Zu den Anweisungen gehören beispielsweise Lachen, Wut, ein bestimmter Akzent, leichter Regen und ein vibrierendes Telefon. Das Unternehmen kündigte außerdem eine verbesserte Unterstützung des Internationalen Phonetischen Alphabets (IPA) an, um die Aussprache von Eigennamen und speziellen Wörtern zu erleichtern.

Stimmklonen und Sprachunterstützung

ElevenLabs zufolge kann Eleven v4 eine Stimme aus einer Aufnahme klonen, die nicht länger als 10 Sekunden ist. Außerdem hat das Unternehmen die Funktion Professional Voice Clone mit dem neuen Modell wieder verfügbar gemacht, nachdem sie in Eleven v3 nicht unterstützt worden war.

Eleven v4 und Eleven v4 Turbo unterstützen mehr als 90 Sprachen, verglichen mit etwa 70 Sprachen bei Eleven v3. Das Unternehmen nennt besondere Verbesserungen für Japanisch, brasilianisches Portugiesisch, Mandarin und Kantonesisch. Außerdem können die geklonten Stimmen nach Angaben des Unternehmens andere Sprachen mit einem natürlicheren lokalen Akzent sprechen.

Was ändert sich praktisch mit v4 Turbo?

Eleven v4 Turbo wurde für sprachbasierte KI-Agenten, Callcenter und Echtzeitanwendungen entwickelt, die direkt von der Reaktionszeit beeinflusst werden. Das Modell unterstützt bidirektionales Streaming, wodurch die Spracherzeugung beginnen kann, bevor die Produktion des gesamten Satzes abgeschlossen ist.

Die Tests des Unternehmens zeigen eine mittlere Zeit bis zum Beginn der Sprachausgabe von etwa 150 Millisekunden, während die mittlere Inferenzzeit etwa 100 Millisekunden beträgt. Diese Zahlen sind weiterhin Ergebnisse von Tests, die ElevenLabs durchgeführt hat, und keine unabhängigen Messungen. Das Unternehmen weist darauf hin, dass das Modell mit dem Sprechen beginnen kann, bevor die Antwort des großen Sprachmodells vollständig vorliegt. Außerdem kann es Szenarien wie einen Streit während des Gesprächs, die Weiterleitung an einen anderen Mitarbeiter oder das Halten des Anrufers akustisch verarbeiten.

Verfügbarkeit und genannte Einschränkungen

Beide Modelle können über ElevenAgents, ElevenCreative und ElevenAPI genutzt und mit kostenlosen Konten ausprobiert werden. Der kostenlose Tarif umfasst 10.000 Einheiten pro Monat, während die kostenpflichtigen Tarife bei 6 US-Dollar pro Monat beginnen. Eleven v4 unterstützt die Erzeugung von bis zu 10.000 Zeichen pro Vorgang sowie Werkzeuge zum Verbinden von Audioclips und zum Bewahren von Rhythmus und Tonfall in langen Inhalten wie Hörbüchern und Podcasts.

Die Bedeutung der Ankündigung liegt in der Verbindung von Verbesserungen beim mehrsprachigen Ausdruck mit einem separaten Pfad für Reaktionen mit geringer Latenz. Die tatsächliche Qualität der Ergebnisse wird jedoch weiterhin von der Sprache, der Art des Textes und der Reaktionszeit in der jeweiligen Nutzungsumgebung abhängen. Zudem muss geprüft werden, ob das Klonen von Stimmen für den vorgesehenen Einsatz geeignet ist. Die Quelle legte keine unabhängigen Tests vor, die die beiden Modelle direkt mit Wettbewerbern vergleichen.

Nachrichtenquelle
c
Autor

certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen