Yapay zekâ

Google yeni Gemini modellerini gerçek zamanlı sesli uygulamalar oluşturmak için kullanıma sunuyor

Google, Gemini API ve Google AI Studio üzerinden geliştiricilerin kullanımına Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking ve Gemini 3.5 Transcribe modellerini sundu. Modeller; diyaloğu sürdürebilen ve görevleri yerine getirebilen sesli aracılar oluşturmaya ve 85’ten fazla dilde düşük hata oranıyla konuşmayı metne dönüştürmeye odaklanıyor.

2026-09-15
3 dk okuma
3 görüntülenme
فريق تحرير certi.news
Google yeni Gemini modellerini gerçek zamanlı sesli uygulamalar oluşturmak için kullanıma sunuyor

Google, Gemini API ve Google AI Studio üzerinden geliştiricilerin kullanımına yeni bir ses modeli grubu sundu. Bu grup, anlık sesli görüşmeler için Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking’i, akış hâlindeki konuşmayı metne dönüştürmek için ise Gemini 3.5 Transcribe’ı içeriyor. Şirket, yeni modellerin yalnızca yanıt vermekle kalmayan; diyalog akışını korurken akıl yürütebilen ve görevleri yerine getirebilen sesli deneyimler oluşturmaya yönelik olduğunu belirtiyor.

Görüşme sırasında görevleri yerine getiren sesli aracılar

Gemini 3.8 Live, speech-to-speech türünde doğrudan ses özellikleri sunuyor. Böylece aracı, görüşmeyi geçici olarak durdurmadan istekleri ele alabiliyor ve işlemleri gerçekleştirebiliyor. Eşzamansız işlev çağırma özelliği, API çağrılarının ve araçların arka planda yürütülmesini sağlarken kullanıcıya verilen sesli yanıtın akışı devam ediyor.

Model ayrıca kullanıcının söyledikleri ve gördükleri için bağlam sağlamak üzere canlı görsel girdiler kullanabiliyor; onay kodları, talep numaraları ve teknik veriler gibi alfasayısal verileri doğru şekilde işleyebiliyor. Modeller 97’den fazla dili destekliyor ve lehçe tutarlılığını koruyor. Bunun yanı sıra anlık sesi, yanıtın kendisindeki yapılandırılmış veri güncellemeleriyle birleştirebiliyor.

Gemini 3.8 Live Extended Thinking ise karmaşık ve çok adımlı sorunlarla ilgilenirken arka planda düşünmeye yönelik ayarlanabilir bir seçenek ekliyor. Google’a göre bu model, Artificial Analysis’in Speech-to-Speech sıralamasında ilk sırada yer alıyor. Duyuruda değerlendirme metodolojisinin veya eksiksiz karşılaştırmanın ayrıntıları açıklanmadı; bu nedenle söz konusu sonuç, kaynakta belirtilen ölçümle sınırlı kalıyor.

85 dilde konuşmayı metne dönüştürme

Google ayrıca düşük gecikmeli konuşma tanıma için tasarlanmış bir model olan Gemini 3.5 Transcribe’ı da kullanıma sundu. Şirket, modelin akış hâlindeki dönüştürmede ortalama %4,0 kelime hata oranına, akış dışı dönüştürmede ise %2,6 oranına ulaştığını belirtiyor. Model 85’ten fazla dili destekliyor ve cümle içinde veya cümleler arasında diller arasındaki geçişi otomatik olarak işleyebiliyor.

Geliştiriciler, tanımayı uzmanlık terimlerine, yaygın olmayan adlara ve şirket adlarına yönlendirmek için 1.000 adede kadar terim içeren özel bir kelime listesi aktarabiliyor. Smart Transcription modu; düzenli biçimlendirme, bazı ifadelerin düzeltilmesi ve dolgu ile tereddüt kelimelerinin silinmesi sayesinde okumaya daha hazır metinler sunuyor.

Geliştiriciler açısından pratikte ne değişiyor?

Bu kullanım imkânı, dinleme, düşünme ve araçları çalıştırmayı anlık ses arayüzlerinde bir araya getiriyor. Böylece konuşmayı metne dönüştürme modeli, diyalog modeli ve metni konuşmaya dönüştürme motorundan oluşan ayrı bir zincir kurma ihtiyacı azalıyor. Ancak duyuru, ses akışı altyapısı gereksinimlerini ortadan kaldırmıyor. Bu nedenle Google, modellere Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel ve Vision Agents gibi entegrasyon ortakları üzerinden de erişim sunuyor.

Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modelleri Live API üzerinden kullanılabiliyor. Açıklanan fiyat, ses girdisinin dakikası başına 0,005 dolar ve ses çıktısının dakikası başına 0,018 dolar. Kaynak, dipnotunda maliyet tahmininin bir milyon giriş tokenı başına 3 dolar ve bir milyon çıkış tokenı başına 12 dolar üzerinden yapıldığını belirtiyor. Bu nedenle geliştiricilerin ölçeği büyütmeden önce gerçek faturalandırma mekanizmasını gözden geçirmesi gerekiyor.

Modeller ai.studio/live üzerinden denenebilir, GitHub’daki örnek uygulamalar kullanılabilir veya Live API becerisinden yararlanılabilir. Google’ın ses grubunda ayrıca 70’ten fazla dilde konuşmadan konuşmaya çeviri için Gemini 3.5 Live Translate, konuşma üretimi için Gemini 3.1 Flash TTS ve müzik üretimi için Lyria 3.5 bulunuyor.

Haber kaynağı
Google Official News
Özgün kaynağı aç ↗
ف
Yazar

فريق تحرير certi.news

Aynı kategoride

Bunlar da ilginizi çekebilir

Tüm haberleri gör