ElevenLabs, ses ifadesini, konuşmacı kimliğinin tutarlılığını ve neredeyse anında yanıt gerektiren uygulamalara desteği geliştirmeye odaklanan bir güncellemeyle Eleven v4 ve Eleven v4 Turbo adlı iki metinden sese dönüştürme modelini piyasaya sürdü. İki model de ElevenAgents, ElevenCreative ve ElevenAPI üzerinden kullanılabiliyor ve ücretsiz hesaplarla denenebiliyor.
Ton ve bağlam üzerinde daha fazla kontrol
Şirket, Eleven v4'ün ses üretirken bağlamı, tonu, konuşma hızını, duyguyu ve kişiliği yorumlayabilen yeni bir mimariye dayandığını söylüyor. Bu özellik, dramatik, acil, komik veya gündelik diyaloglar gibi sahnenin niteliğine göre anlatım tarzını değiştirirken uzun metinlerde konuşmacı kimliğini korumayı hedefliyor.
Model ayrıca sonraki cümlelerin tonunu ayarlamak için konuşma içindeki önceki cümlelerden yararlanabiliyor. ElevenLabs, Eleven v3 ile ortaya çıkan ses etiketleri sistemini de genişletti; böylece birden fazla talimatı isteğe eklemek ve bunları belirli bir sırayla uygulamak mümkün hâle geldi. Talimatlara kahkaha, öfke, belirli bir aksan, hafif yağmur ve telefon titreşimi örnek olarak veriliyor. Şirket ayrıca özel kelimelerin ve isimlerin telaffuzuna yardımcı olmak için Uluslararası Fonetik Alfabe (IPA) desteğini geliştirdiğini duyurdu.
Ses klonlama ve dil desteği
ElevenLabs'e göre Eleven v4, süresi 10 saniyeyi geçmeyen bir kayıttan ses klonlayabiliyor. Şirket ayrıca Eleven v3'te desteklenmeyen Professional Voice Clone özelliğini yeni modelle yeniden kullanıma sundu.
Eleven v4 ve Eleven v4 Turbo, Eleven v3'teki yaklaşık 70 dile kıyasla 90'dan fazla dili destekliyor. Şirket, değerlendirmesine göre Japonca, Brezilya Portekizcesi, Mandarin ve Kantonca'da özel iyileştirmeler bulunduğunu ve ses klonlarının başka dilleri daha doğal bir yerel aksanla konuşabildiğini belirtiyor.
v4 Turbo ile pratikte ne değişiyor?
Eleven v4 Turbo, yanıt süresinden doğrudan etkilenen sesli yapay zekâ ajanları, çağrı merkezleri ve anlık uygulamalar için tasarlandı. Model, çift yönlü akışı destekliyor; bu da ses üretiminin tüm cümle tamamlanmadan başlamasına olanak tanıyor.
Şirketin testlerine göre ses çıkışının başlaması için gereken medyan süre yaklaşık 150 milisaniye, çıkarım süresinin medyanı ise yaklaşık 100 milisaniye. Bu rakamlar ElevenLabs'in gerçekleştirdiği testlerin sonuçları olup bağımsız ölçümler değil. Şirket, modelin büyük dil modelinin yanıtı tamamlanmadan konuşmaya başlayabildiğini ve görüşme sırasında anlaşmazlık, başka bir temsilciye aktarma veya arayanı beklemeye alma gibi senaryoları sesli olarak ele alabildiğini belirtiyor.
Kullanılabilirlik ve açıklanan sınırlamalar
İki model de ElevenAgents, ElevenCreative ve ElevenAPI üzerinden kullanılabiliyor ve ücretsiz hesaplarla denenebiliyor. Ücretsiz plan aylık 10 bin kredi içeriyor; ücretli planlar ise aylık 6 dolardan başlıyor. Eleven v4, tek bir işlemde 10 bine kadar karakter üretmeyi destekliyor; ayrıca sesli kitaplar ve podcast'ler gibi uzun içeriklerde ses parçalarını birleştirmeye, ritmi ve tonu korumaya yönelik araçlar sunuyor.
Duyurunun önemi, çok dilli ifade geliştirmelerini düşük gecikmeli yanıt için ayrı bir hatla bir araya getirmesinde yatıyor; ancak gerçek sonuçların kalitesi dil, metnin niteliği ve kullanım ortamındaki yanıt süresiyle bağlantılı olmaya devam edecek. Ayrıca ses klonlamanın amaçlanan kullanım için uygunluğunun doğrulanması gerekiyor. Kaynak, iki modeli rakiplerle doğrudan karşılaştıran bağımsız testler sunmadı.