Google, metni sese dönüştürmek üzere Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS modellerini duyurdu. Modeller, daha ifade gücü yüksek sesler oluşturmaya ve metindeki her satırın nasıl seslendirileceğini kontrol etmeye odaklanıyor. Şirket, iki modelin sesli kitaplar, podcast’ler, sesli ajanlar ve etkileşimli deneyimler geliştiren geliştiricileri, içerik üreticilerini ve kurumları hedeflediğini belirtiyor.
İki farklı kullanım için iki model
Gemini 3.8 Flash TTS, doğal dildeki komutlarla özel sesler ve karakterler oluşturmak üzere tasarlandı. Model, 100’den fazla dil ve lehçede rol, aksan ve ses özellikleri üzerinde kontrol sağlıyor. Google ayrıca Meksika İspanyolcası, Quebec Fransızcası ve İskoç İngilizcesi gibi bölgesel varyasyonları da içeren, üretime hazır 2000’den fazla sesten oluşan bir kütüphane sunuyor.
Gemini 3.8 Flash-Lite TTS ise dublaj, sesli içerik üretimi ve tonlama, ritim ve ifade ayrıntıları üzerinde geniş ölçekte kontrol gerektiren sesli ajanlar gibi yüksek hacimli ve daha düşük maliyetli kullanım alanlarına odaklanıyor.
Ses performansı üzerinde ayrıntılı kontrol
İki model de hız, duygu, aksan ve performans biçimini belirleyen talimatlarla seslendirmeyi satır satır yönlendirmeye olanak tanıyor. Yetenekler arasında tek bir metinden iki konuşmacılı diyalog sahneleri oluşturma, iki ses arasındaki farkı koruma ve konuşmacı değişimlerini düzenlemenin yanı sıra gülme, iç çekme, nefes nefese kalma ve kısa dinleme işaretleri gibi sözsüz ses efektleri de bulunuyor.
Google, Flash TTS’nin saatler süren uzun ses üretimleri boyunca ses kalitesini, ritmini ve karakter kimliğini koruyabildiğini, konuşmacının özelliklerindeki değişimi azalttığını belirtiyor. Şirket ayrıca sesleri yeniden mikslemeye yönelik bir özellik üzerinde çalışıyor. Bu özellik ses perdesini, hızı ve aksanı değiştirmeye olanak tanıyacak, ancak hâlâ «yakında geliyor» aşamasında.
Ses klonlama ve açıklanan kontroller
30 saniye uzunluğunda bir ses örneğinden tutarlı bir ses profili oluşturulabiliyor; bunun için sesin kullanıcıya ait olması veya kullanıcının sesi kullanma haklarına sahip olması gerekiyor. Google, ses sahibinin sözlü onayının kaydedilmesini ve sesli kopya oluşturulmadan önce referans konuşmacıyla eşleştirilmesini talep ediyor.
Şirket, Gemini Audio modellerinin ürettiği her ses klibinin SynthID aracılığıyla görünmez bir filigran taşıdığını ve ses klonlama özelliklerinde C2PA kimlik bilgilerinin kullanıldığını vurguluyor. Bu mekanizmalar, yapay zekâ tarafından üretilen sesin tespit edilmesini kolaylaştırmayı ve kaynağının şeffaflığını artırmayı amaçlıyor. Bununla birlikte, başka bir kişinin sesini kullanma izni ve düzenleyici kısıtlamalar, teknik doğrulama mekanizmasının dışında belirleyici faktörler olmaya devam ediyor.
Kullanılabilirlik ve pratikte ne değişiyor?
Gemini 3.8 Flash TTS’nin geliştiricilere Gemini API ve Google AI Studio üzerinden, kullanıcılara ise Gemini Notebook üzerinden sunulmaya başlanmasıyla birlikte, modelin daha sonra Gemini Enterprise’da API üzerinden de kullanılabilir olması planlanıyor. Flash-Lite TTS’nin dağıtımı ise Google Vids üzerinden başladı. Google ayrıca Agora, LiveKit, Pipecat, Vercel, Figma, HeyGen, Wondercraft ve Ollang gibi platform ve şirketlerle ortaklıklar veya entegrasyonlar duyurdu.
Pratikte duyuru, metinden sese dönüşümü sabit seslere dayanmaktan çıkarıp ses performansının yönetimine daha yakın bir iş akışına taşıyor: karakter tasarlama, seslendirme talimatlarını yazma ve ardından uzun ya da çok dilli bir diyalog üretme. Google, Flash TTS’nin Hume AI’ın Voice Design Benchmark ölçütünde 71,4 puanla, aksan modellemesinde ise 60,8 puanla birinci olduğunu; ayrıca iki modelin kendi toplam kalite endeksinde birinci ve ikinci sırayı aldığını belirtiyor. Bunlar, şirketin duyuru kapsamında sunduğu sonuçlar olup gerçek üretim senaryolarında maliyet ve performans açısından bağımsız değerlendirmenin yerini tutmuyor.
Duyuruda belirtilen kısıtlamalara göre AI Studio üzerinden ses klonlama özelliği Illinois, Teksas, Avrupa Ekonomik Alanı, Birleşik Krallık, İsviçre ve Hindistan’da kullanılamıyor.