Yapay zekâ

Google, çok dilli anlık sesli transkripsiyon için Gemini 3.5 Transcribe’ı kullanıma sunuyor

Google, anlık transkripsiyon ve kaydedilmiş dosyaları hedefleyen; gürültü işleme, metin biçimlendirme ve konuşmacı tanıma özelliklerine sahip bir konuşmadan metne modeli olan Gemini 3.5 Transcribe’ı duyurdu. Model, Gemini API ve Google’ın geliştiricilere ve kurumlara yönelik platformları üzerinden genel önizlemede sunuluyor ve Google uygulamalarına kademeli olarak entegre ediliyor.

2026-08-26
4 dk okuma
9 görüntülenme
فريق تحرير certi.news
Google, çok dilli anlık sesli transkripsiyon için Gemini 3.5 Transcribe’ı kullanıma sunuyor

Google, 26 Ağustos 2026’da Gemini 3.5 Transcribe’ı duyurdu. Bu, anlık sesli transkripsiyon ve akıllı sesli etkileşimler için tasarlanmış yeni bir konuşmadan metne modelidir. Şirket, modelin ham sesi yalnızca kelimelere dönüştürmekle kalmadığını; gürültüyü ve kendi kendine yapılan düzeltmeleri temizlediğini, uzmanlık terimlerini tanıdığını ve kullanıma hazır biçime daha yakın, biçimlendirilmiş metin ürettiğini belirtiyor.

Model; sesli ajanlar, gerçek zamanlı çeviri veya altyazı araçları ve kaydedildikten sonra aramaları ve toplantıları analiz etmeye yönelik iş akışları geliştiren geliştiricileri hedefliyor. Model, Google AI Studio’daki Gemini API üzerinden ve Gemini Enterprise Agent Platform üzerinden kullanılabiliyor.

Farklı kullanımlar için iki arayüz

Google, modeli iki ayrı arayüz üzerinden sunuyor. İlki, gemini-3.5-transcribe-live modelini kullanan Live API. Bu API, etkileşimli sesli konuşma uygulamaları için uygun olan, bir saniyeden kısa gecikmeyle sürekli çift yönlü akış sağlıyor. İkincisi ise konuşmayı konuşmacılara atfetme ve kelime düzeyinde zaman damgaları ekleme özellikleriyle kayıtları, toplantıları ve arama günlüklerini işlemek için gemini-3.5-transcribe modelini kullanan Interactions API.

Google, Gemini 3.5 Transcribe’ın konuşma sırasında bir randevuyu veya kelimeyi değiştirme gibi kendi kendine yapılan düzeltmeleri işleyebildiğini, kekeleme gibi dolgu kelimelerini kaldırabildiğini ve metni otomatik olarak biçimlendirebildiğini söylüyor. Model ayrıca uzmanlık terimlerini ve alışılmadık yazımları tanıyabilmesi için sağlanabilen özel kelime dağarcıklarını destekliyor; lehçeler ve bölgesel aksanlarla birlikte 85’ten fazla dili algılayıp yazıya dökebiliyor.

Kaydedilmiş konuşmalarda model, kelime düzeyinde zaman damgalarıyla en fazla üç konuşmacının sözlerini belirleyebiliyor; üçten fazla konuşmacı desteği ise hâlâ deneysel. Model ayrıca yayın sırasında diller arasında geçiş yapılmasını da işleyebiliyor. Bu, çok dilli konuşmalar için önemli bir özellik; ancak kaynak, desteklenen tüm diller veya her dil için performans sınırları hakkında ayrıntı sunmuyor.

Chirp 3 ile karşılaştırmalı performans rakamları

Google’ın atıfta bulunduğu Artificial Analysis ölçümlerine göre model, akışlı senaryolarda ortalama %4,0, akışsız kullanım senaryolarında ise %2,6 kelime hata oranına ulaştı. Çeşitli diller ve bölgelerden oluşan FLEURS ölçütünde akışlı kullanımda %5,50, akışsız kullanımda ise %5,04 kelime hata oranı kaydetti. Şirket, nihai transkripsiyona ulaşma gecikmesinin önceki transkripsiyon modeli Chirp 3’e kıyasla %70 iyileştiğini belirtiyor.

Bu rakamlar doğruluk ve hızda ikili bir iyileşmeye işaret ediyor; ancak karşılaştırma, sonuçların her ses ortamında aynı olacağı anlamına gelmiyor. Sonuçlar ölçüte, dile, kayıt kalitesine, konuşmacı sayısına ve gürültü düzeyine bağlı. Ayrıca kaynak, Artificial Analysis’in metodolojisini ayrıntılı biçimde açıklamıyor ve dile göre sonuçların tam bir tablosunu sunmuyor.

Google arayüzlerinden geliştirici araçlarına

Google, modeli hâlihazırda Gemini uygulamasında ve bazı Android deneylerinde kullanıyor. Bunlar arasında konuşmayı biçimlendirilmiş metne dönüştüren, dolgu kelimelerinin kaldırılmasına ve düzeltmeler yapılmasına olanak tanıyan ve sesle yazım stilinin değiştirilmesini sağlayan Rambler özelliği de bulunuyor. macOS’taki Gemini uygulamasında sesli komutlar, yerel dosyaları özetleme, uygulamalar arasında metni yeniden kullanma veya diğer Gemini modellerini çağırarak görseller oluşturma gibi görevleri gerçekleştirmek için ekran bağlamından yararlanabiliyor.

Google Antigravity, kullanıcı izni alındıktan sonra etkin dosyaların ve belgelerin adlarını ve ajanın fikirlerini daha iyi tanımak için ekran bağlamını ve konuşma geçmişini kullanıyor. Modele, ses kullanarak uygulamalar oluşturmak için Google AI Studio’daki Build modu üzerinden de erişilebiliyor. Google, herhangi bir web alanında dikte özelliğinin yakında Chrome’a geleceğini söylüyor.

Pratikte ne değişiyor?

En önemli değişim, sesli transkripsiyonun ilk aşamadaki bir döküm adımından, konuşmayı anlayan, temizleyen ve uygulamanın bağlamıyla ilişkilendiren bir katmana dönüşmesi. Geliştiriciler açısından bu, her düzeltme veya dolgu kelimesi için ayrı işlem gerektirmeyen sesli arayüzler oluşturabilmek ve ürünün niteliğine göre anlık akış ya da arşivlenmiş kayıtları kullanabilmek anlamına geliyor.

Gemini 3.5 Transcribe şu anda Google AI Studio ve Google Antigravity’de Gemini API üzerinden geliştiriciler için, Gemini Enterprise Agent Platform üzerinden ise kurumlar için genel önizlemede sunuluyor. Daha sonra Gemini Enterprise for Customer Experience’a ulaşması planlanıyor. Kullanıcılar için model, macOS’ta Gemini uygulamasında İngilizce olarak kullanılabiliyor; Rambler ise Android’de belirli ülkelerde ve dillerde sunuluyor ve Chrome’a gelmesi bekleniyor.

Haber kaynağı
Google Official News
Özgün kaynağı aç ↗
ف
Yazar

فريق تحرير certi.news

Aynı kategoride

Bunlar da ilginizi çekebilir

Tüm haberleri gör