Künstliche Intelligenz

Google bringt die Modelle Gemini 3.8 Flash TTS und Flash-Lite zur anpassbaren Text-to-Speech-Umwandlung auf den Markt

Google hat zwei neue Modelle zur Umwandlung von Text in Sprache angekündigt, mit denen sich benutzerdefinierte Stimmen erstellen, die Darbietung Zeile für Zeile steuern und Dialoge mit mehreren Sprechern in mehr als 100 Sprachen erzeugen lassen. Gemini 3.8 Flash TTS ist für Entwickler über die Gemini API und Google AI Studio verfügbar, während Flash-Lite auf umfangreiche Audioanwendungen abzielt.

2026-09-23
4 Min. Lesezeit
73 Aufrufe
certi.news Editorial Team
Google bringt die Modelle Gemini 3.8 Flash TTS und Flash-Lite zur anpassbaren Text-to-Speech-Umwandlung auf den Markt

Google hat die Modelle Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS zur Umwandlung von Text in Sprache angekündigt. Der Schwerpunkt liegt dabei auf der Erstellung ausdrucksstärkerer Stimmen und der Steuerung der Art und Weise, wie jede Textzeile vorgetragen wird. Das Unternehmen erklärt, dass sich die beiden Modelle an Entwickler, Kreative und Unternehmen richten, die Hörbücher, Podcasts, Sprachagenten und interaktive Erlebnisse entwickeln.

Zwei Modelle für unterschiedliche Einsatzbereiche

Gemini 3.8 Flash TTS wurde dafür entwickelt, mithilfe natürlichsprachlicher Anweisungen benutzerdefinierte Stimmen und Figuren zu erstellen und dabei Rolle, Akzent und Stimmeigenschaften in mehr als 100 Sprachen und Dialekten zu steuern. Google stellt außerdem eine Bibliothek mit mehr als 2000 produktionsbereiten Stimmen bereit, darunter regionale Varianten wie mexikanisches Spanisch, Québec-Französisch und schottisches Englisch.

Gemini 3.8 Flash-Lite TTS konzentriert sich dagegen auf umfangreiche und kostengünstigere Anwendungen wie Synchronisation, die Produktion von Audioinhalten und Sprachagenten, die eine groß angelegte Steuerung von Tonfall, Rhythmus und ausdrucksstarken Details benötigen.

Detaillierte Steuerung der stimmlichen Darbietung

Mit beiden Modellen lässt sich der Vortrag Zeile für Zeile mithilfe von Anweisungen steuern, die Geschwindigkeit, Emotion, Akzent und Darbietungsart festlegen. Zu den Funktionen gehört die Erstellung von Dialogszenen mit zwei Sprechern aus einem einzigen Text, wobei die Unterschiede zwischen den beiden Stimmen erhalten bleiben und der Sprecherwechsel organisiert wird. Hinzu kommen nonverbale Soundeffekte wie Lachen, Seufzen, Keuchen und kurze Hörsignale.

Google zufolge kann Flash TTS bei einer mehrere Stunden langen Audioproduktion die Sprachqualität, den Rhythmus und die Identität der Figur beibehalten und dabei Veränderungen der Eigenschaften des Sprechers reduzieren. Das Unternehmen arbeitet außerdem an einer Funktion zum Remixen von Stimmen, mit der sich Tonhöhe, Geschwindigkeit und Akzent anpassen lassen; diese ist jedoch weiterhin „demnächst verfügbar“.

Stimmklonen und die angekündigten Schutzmaßnahmen

Ausgehend von einer 30 Sekunden langen Sprachprobe lässt sich ein konsistentes Sprachprofil erstellen, sofern die Probe dem Nutzer gehört oder er über die entsprechenden Nutzungsrechte verfügt. Google verlangt, dass die verbale Einwilligung des Besitzers der Stimme aufgezeichnet und vor der Erstellung der Stimmkopie mit dem Referenzsprecher abgeglichen wird.

Das Unternehmen betont, dass jeder von den Gemini-Audio-Modellen erzeugte Audioclip über SynthID ein nicht sichtbares Wasserzeichen trägt. Zusätzlich werden bei den Funktionen zum Stimmklonen C2PA-Nachweise verwendet. Diese Mechanismen sollen die Erkennung von durch künstliche Intelligenz erzeugter Sprache erleichtern und die Transparenz ihrer Herkunft verbessern. Dennoch bleiben die Zustimmung zur Nutzung der Stimme einer anderen Person und regulatorische Einschränkungen außerhalb des technischen Prüfmechanismus selbst entscheidende Faktoren.

Verfügbarkeit und was sich praktisch ändert

Die Einführung von Gemini 3.8 Flash TTS für Entwickler über die Gemini API und Google AI Studio sowie für Nutzer über Gemini Notebook hat begonnen; später soll es über eine API in Gemini Enterprise verfügbar werden. Flash-Lite TTS wird ebenfalls schrittweise über Google Vids eingeführt. Außerdem kündigte Google Partnerschaften oder Integrationen mit Plattformen und Unternehmen wie Agora, LiveKit, Pipecat, Vercel, Figma, HeyGen, Wondercraft und Ollang an.

In der Praxis verlagert die Ankündigung die Umwandlung von Text in Sprache weg von der Abhängigkeit von festen Stimmen hin zu einem Arbeitsablauf, der stärker der Inszenierung einer stimmlichen Darbietung ähnelt: die Gestaltung einer Figur, das Verfassen von Anweisungen für den Vortrag und anschließend die Produktion eines langen oder mehrsprachigen Dialogs. Google erklärt, dass Flash TTS im Voice Design Benchmark von Hume AI mit einer Punktzahl von 71,4 den ersten Platz belegte und bei der Dialektmodellierung 60,8 Punkte erreichte. Außerdem belegten die beiden Modelle in Googles Gesamtsqualitätsindex den ersten und zweiten Platz. Diese Ergebnisse wurden vom Unternehmen im Rahmen der Ankündigung vorgelegt und ersetzen keine unabhängige Bewertung von Kosten und Leistung in tatsächlichen Produktionsszenarien.

Die Funktion zum Klonen von Stimmen ist über AI Studio in Illinois, Texas, dem Europäischen Wirtschaftsraum, dem Vereinigten Königreich, der Schweiz und Indien gemäß den in der Ankündigung genannten Einschränkungen nicht verfügbar.

Nachrichtenquelle
Google Official News
Originalquelle öffnen ↗
c
Autor

certi.news Editorial Team

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen