أعلنت Google عن نموذجي Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS لتحويل النص إلى كلام، مع تركيز على إنشاء أصوات أكثر تعبيراً والتحكم في طريقة إلقاء كل سطر من النص. وتقول الشركة إن النموذجين يستهدفان المطورين والمنشئين والمؤسسات التي تبني الكتب الصوتية والبودكاست ووكلاء الصوت والتجارب التفاعلية.
نموذجان لاستخدامين مختلفين
صُمم Gemini 3.8 Flash TTS لإنشاء أصوات وشخصيات مخصصة من خلال أوامر باللغة الطبيعية، مع التحكم في الدور واللهجة وخصائص الصوت عبر أكثر من 100 لغة ولهجة. كما تتيح Google مكتبة تضم أكثر من 2000 صوت جاهز للإنتاج، تشمل تنويعات إقليمية مثل الإسبانية المكسيكية والفرنسية الكيبيكية والإنجليزية الاسكتلندية.
أما Gemini 3.8 Flash-Lite TTS فيركز على الاستخدامات عالية الحجم والأقل كلفة، مثل الدبلجة وإنتاج المحتوى الصوتي ووكلاء الصوت الذين يحتاجون إلى التحكم في النبرة والإيقاع والتفاصيل التعبيرية على نطاق واسع.
تحكم تفصيلي في الأداء الصوتي
يتيح النموذجان توجيه الإلقاء سطراً بسطر باستخدام تعليمات تحدد السرعة والانفعال واللهجة وطريقة الأداء. وتشمل القدرات إنشاء مشاهد حوارية لمتحدثين اثنين من نص واحد، مع الحفاظ على اختلاف الصوتين وتنظيم تبادل الأدوار، إضافة إلى مؤثرات صوتية غير لفظية مثل الضحك والتنهد واللهاث وإشارات الاستماع القصيرة.
وتقول Google إن Flash TTS يستطيع الحفاظ على جودة الصوت وإيقاعه وهوية الشخصية خلال إنتاج صوتي طويل يمتد لساعات، مع تقليل تغير خصائص المتحدث. كما تعمل الشركة على ميزة لإعادة مزج الأصوات، تتيح تعديل طبقة الصوت والسرعة واللهجة، لكنها لا تزال «قادمة قريباً».
استنساخ الصوت والضوابط المعلنة
يمكن إنشاء ملف صوتي متسق من عينة صوتية مدتها 30 ثانية، شرط أن تكون للمستخدم أو أن يملك حقوق استخدامها. وتطلب Google تسجيل موافقة لفظية من صاحب الصوت ومطابقتها مع المتحدث المرجعي قبل إنشاء النسخة الصوتية.
وتؤكد الشركة أن كل مقطع صوتي تنتجه نماذج Gemini Audio يحمل علامة مائية غير ظاهرة عبر SynthID، إلى جانب استخدام بيانات اعتماد C2PA في قدرات استنساخ الصوت. وتهدف هذه الآليات إلى تسهيل اكتشاف الصوت المولد بالذكاء الاصطناعي وتعزيز شفافية مصدره. مع ذلك، تظل الموافقة على استخدام صوت شخص آخر والقيود التنظيمية عوامل حاسمة خارج آلية التحقق التقنية نفسها.
التوفر وما الذي يتغير عملياً؟
بدأ طرح Gemini 3.8 Flash TTS للمطورين عبر Gemini API وGoogle AI Studio، وللمستخدمين عبر Gemini Notebook، على أن يتوفر لاحقاً عبر API في Gemini Enterprise. أما Flash-Lite TTS فبدأ طرحه عبر Google Vids. كما أعلنت Google شراكات أو تكاملات مع منصات وشركات منها Agora وLiveKit وPipecat وVercel وFigma وHeyGen وWondercraft وOllang.
عملياً، ينقل الإعلان تحويل النص إلى كلام من الاعتماد على أصوات ثابتة إلى سير عمل أقرب إلى إخراج الأداء الصوتي: تصميم شخصية، كتابة تعليمات الإلقاء، ثم إنتاج حوار طويل أو متعدد اللغات. وتقول Google إن Flash TTS احتل المركز الأول في معيار Voice Design Benchmark من Hume AI بدرجة 71.4 وفي نمذجة اللهجات بدرجة 60.8، كما حصل النموذجان على المركزين الأول والثاني في مؤشر الجودة الإجمالية لديها. هذه نتائج مقدمة من الشركة ضمن الإعلان، ولا تغني عن تقييم مستقل للتكلفة والأداء في سيناريوهات الإنتاج الفعلية.
ولا تتوفر ميزة استنساخ الصوت عبر AI Studio في إلينوي وتكساس والمنطقة الاقتصادية الأوروبية والمملكة المتحدة وسويسرا والهند، وفق القيود المذكورة في الإعلان.
كيف أعددنا هذا الخبر؟
اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة،
لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة.
اقرأ سياستنا التحريرية.