Intelligence artificielle

Google lance Gemini 3.5 Transcribe pour la transcription audio instantanée multilingue

Google a annoncé Gemini 3.5 Transcribe, un modèle de conversion de la parole en texte destiné à la transcription instantanée et aux fichiers enregistrés, avec traitement des hésitations, mise en forme du texte et identification des locuteurs. Le modèle est disponible en aperçu public via Gemini API et les plateformes Google pour les développeurs et les entreprises, avec une intégration progressive dans les applications Google.

2026-08-26
6 min de lecture
9 vues
فريق تحرير certi.news
Google lance Gemini 3.5 Transcribe pour la transcription audio instantanée multilingue

Google a annoncé le 26 août 2026 le Gemini 3.5 Transcribe, un nouveau modèle de conversion de la parole en texte conçu pour la transcription audio instantanée et les interactions vocales intelligentes. Plutôt que de se contenter de transformer l’audio brut en mots, l’entreprise affirme que le modèle nettoie les hésitations et les autocorrections, reconnaît les termes spécialisés et produit un texte mis en forme, plus proche d’un résultat prêt à l’emploi.

Le modèle cible les développeurs qui conçoivent des agents vocaux, des outils de traduction ou de sous-titrage en temps réel, ainsi que des pipelines de traitement destinés à analyser les appels et les réunions après leur enregistrement. Il est disponible via Gemini API dans Google AI Studio, ainsi que via Gemini Enterprise Agent Platform.

Deux interfaces pour deux usages différents

Google propose le modèle au moyen de deux interfaces distinctes. La première est la Live API, qui utilise le modèle gemini-3.5-transcribe-live et fournit une diffusion continue bidirectionnelle avec un temps de réponse inférieur à une seconde, ce qui convient aux applications de conversation vocale interactive. La seconde est l’Interactions API, qui utilise gemini-3.5-transcribe pour traiter les enregistrements, les réunions et les journaux d’appels, avec attribution de la parole aux locuteurs et ajout d’horodatages au niveau des mots.

Google affirme que Gemini 3.5 Transcribe peut gérer les autocorrections, comme la modification d’une date ou d’un mot en cours de phrase, supprimer les mots de remplissage tels que les hésitations et mettre automatiquement le texte en forme. Il prend également en charge les vocabulaires personnalisés, qui peuvent lui être fournis pour reconnaître les termes spécialisés et les graphies inhabituelles, et il prend en charge la détection et la transcription de plus de 85 langues, avec gestion des dialectes et des accents régionaux.

Dans les enregistrements, le modèle attribue la parole à jusqu’à trois locuteurs avec des horodatages, tandis que la prise en charge de plus de trois locuteurs reste expérimentale. Il peut également gérer le passage d’une langue à une autre pendant la diffusion, une fonctionnalité importante dans les conversations multilingues, mais la source ne fournit pas de détails sur l’ensemble des langues prises en charge ni sur les limites de performance pour chacune d’elles.

Chiffres de performance comparés à Chirp 3

Selon les mesures d’Artificial Analysis citées par Google, le modèle a atteint un taux moyen d’erreur de mots de 4,0 % dans les cas de diffusion et de 2,6 % dans les cas d’utilisation non diffusés en continu. Sur le benchmark FLEURS, couvrant un ensemble de langues et de régions, il a enregistré un taux d’erreur de mots de 5,50 % en diffusion et de 5,04 % en utilisation non diffusée. L’entreprise affirme que la latence jusqu’à la transcription finale a été réduite de 70 % par rapport au précédent modèle de transcription, Chirp 3.

Ces chiffres indiquent une double amélioration de la précision et de la vitesse, mais la comparaison ne signifie pas que les résultats seront identiques dans tous les environnements audio : ils dépendent du benchmark, de la langue, de la qualité de l’enregistrement, du nombre de locuteurs et du niveau de bruit. La source ne précise pas non plus en détail la méthodologie d’Artificial Analysis et ne fournit pas de tableau complet des résultats par langue.

Des interfaces Google aux outils pour développeurs

Google utilise déjà le modèle dans l’application Gemini et dans certaines expériences Android, notamment la fonctionnalité Rambler, qui transforme la parole en texte mis en forme et permet de supprimer les mots de remplissage, d’effectuer des corrections et de modifier vocalement le style d’écriture. Dans l’application Gemini sur macOS, les commandes vocales peuvent exploiter le contexte de l’écran pour effectuer des tâches telles que résumer des fichiers locaux, réutiliser du texte entre les applications ou générer des images en appelant d’autres modèles Gemini.

Google Antigravity utilise le contexte de l’écran et l’historique des conversations, après obtention de l’autorisation de l’utilisateur, afin d’améliorer la reconnaissance des noms de fichiers, des documents actifs et des idées de l’agent. Le modèle est également accessible en mode Build dans Google AI Studio pour créer des applications à l’aide de la voix. Google indique que la fonctionnalité de dictée dans n’importe quel champ web arrivera bientôt dans Chrome.

Qu’est-ce qui change concrètement ?

Le changement le plus important est le passage de la transcription audio d’une simple étape de retranscription initiale à une couche capable de comprendre et de nettoyer la parole, tout en la reliant au contexte de l’application. Pour les développeurs, cela signifie qu’il devient possible de créer des interfaces vocales qui ne nécessitent pas un traitement distinct pour chaque correction ou mot de remplissage, avec la possibilité d’utiliser la diffusion instantanée ou les enregistrements archivés selon la nature du produit.

Gemini 3.5 Transcribe est actuellement disponible en aperçu public pour les développeurs via Gemini API dans Google AI Studio et Google Antigravity, et pour les entreprises via Gemini Enterprise Agent Platform, avant une arrivée ultérieure dans Gemini Enterprise for Customer Experience. Pour les utilisateurs, il est disponible dans l’application Gemini sur macOS en anglais, tandis que Rambler est disponible sur Android dans certains pays et certaines langues, avec une arrivée prochaine dans Chrome.

Source de l’actualité
Google Official News
Ouvrir la source originale ↗
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités