Künstliche Intelligenz

Google bringt neue Gemini-Modelle für die Entwicklung von Echtzeit-Sprachanwendungen auf den Markt

Google hat Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking und Gemini 3.5 Transcribe über die Gemini API und Google AI Studio für Entwickler verfügbar gemacht. Die Modelle zielen auf die Entwicklung von Sprachagenten ab, die Gespräche weiterführen und Aufgaben ausführen können, sowie auf eine fehlerarme Umwandlung von Sprache in Text in mehr als 85 Sprachen.

2026-09-15
4 Min. Lesezeit
3 Aufrufe
فريق تحرير certi.news
Google bringt neue Gemini-Modelle für die Entwicklung von Echtzeit-Sprachanwendungen auf den Markt

Google hat eine neue Gruppe von Audiomodellen über die Gemini API und Google AI Studio für Entwickler verfügbar gemacht. Dazu gehören Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking für sofortige Sprachgespräche sowie Gemini 3.5 Transcribe zur Umwandlung von gestreamter Sprache in Text. Nach Angaben des Unternehmens sind die neuen Modelle auf die Entwicklung von Spracherlebnissen ausgerichtet, die nicht nur antworten, sondern auch Schlussfolgerungen ziehen und Aufgaben ausführen können, während der Gesprächsfluss erhalten bleibt.

Sprachagenten, die während des Gesprächs Aufgaben ausführen

Gemini 3.8 Live bietet direkte Sprachfunktionen nach dem Speech-to-Speech-Prinzip, sodass der Agent Anfragen bearbeiten und Aktionen ausführen kann, ohne das Gespräch zu unterbrechen. Die Funktion für asynchrone Funktionsaufrufe ermöglicht es, API-Aufrufe und Tools im Hintergrund auszuführen, während die gesprochene Antwort für den Nutzer weiter gestreamt wird.

Das Modell kann außerdem Live-Bildeingaben nutzen, um Kontext für das Gesagte und Gesehene des Nutzers bereitzustellen, und alphanumerische Daten wie Bestätigungscodes, Anspruchsnummern und technische Daten präzise verarbeiten. Die Modelle unterstützen mehr als 97 Sprachen und bewahren dabei die Konsistenz des Akzents. Zusätzlich können sofortige Sprache und strukturierte Datenaktualisierungen in derselben Antwort kombiniert werden.

Gemini 3.8 Live Extended Thinking ergänzt eine anpassbare Option für Hintergrunddenken bei komplexen Aufgaben mit mehreren Schritten. Laut Google belegt dieses Modell im Speech-to-Speech-Ranking von Artificial Analysis den ersten Platz. Die Ankündigung erläuterte weder die Bewertungsmethodik noch den vollständigen Vergleich. Daher bleibt dieses Ergebnis an die im Ausgangsmaterial genannte Messung gebunden.

Umwandlung von Sprache in Text in 85 Sprachen

Google hat außerdem Gemini 3.5 Transcribe eingeführt, ein Modell zur Spracherkennung mit geringer Latenz. Das Unternehmen gibt an, dass das Modell eine durchschnittliche Wortfehlerrate von 4,0 % bei der gestreamten Umwandlung und von 2,6 % bei der nicht gestreamten Umwandlung erreicht hat. Es unterstützt mehr als 85 Sprachen und kann den automatischen Wechsel zwischen Sprachen innerhalb eines Satzes oder zwischen Sätzen verarbeiten.

Entwickler können eine benutzerdefinierte Wortliste mit bis zu 1.000 Begriffen übergeben, um die Erkennung auf Fachbegriffe, ungewöhnliche Namen und Unternehmensnamen auszurichten. Der Modus Smart Transcription liefert durch strukturierte Formatierung, die Korrektur bestimmter Formulierungen sowie die Entfernung von Füll- und Zögerungswörtern besser lesbare Transkripte.

Was ändert sich praktisch für Entwickler?

Diese Verfügbarkeit verbindet Zuhören, Denken und die Ausführung von Tools in sofortigen Sprachschnittstellen. Dadurch sinkt der Bedarf, separate Ketten aus einem Sprach-zu-Text-Modell, einem Gesprächsmodell und einer Text-zu-Sprache-Engine aufzubauen. Die Ankündigung beseitigt jedoch nicht die Anforderungen an die Infrastruktur für Audiostreaming. Deshalb bietet Google den Zugang zu den Modellen auch über Integrationspartner wie Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel und Vision Agents an.

Die Modelle Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking sind über die Live API verfügbar. Der angegebene Preis beträgt 0,005 US-Dollar pro Minute für Spracheingaben und 0,018 US-Dollar pro Minute für Sprachausgaben. Die Quelle weist in einer Fußnote darauf hin, dass die Kostenschätzung auf 3 US-Dollar pro einer Million Eingabetoken und 12 US-Dollar pro einer Million Ausgabetoken basiert. Entwickler sollten daher vor einer Ausweitung die tatsächliche Abrechnungsmethode prüfen.

Die Modelle können über ai.studio/live ausprobiert werden. Alternativ können Beispielanwendungen von GitHub genutzt oder die Live-API-Funktion eingesetzt werden. Googles Audiomodellreihe umfasst außerdem Gemini 3.5 Live Translate für die Sprach-zu-Sprach-Übersetzung in mehr als 70 Sprachen, Gemini 3.1 Flash TTS zur Sprachgenerierung und Lyria 3.5 zur Musikgenerierung.

Nachrichtenquelle
Google Official News
Originalquelle öffnen ↗
ف
Autor

فريق تحرير certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen