أعلنت Google إتاحة مجموعة جديدة من نماذج الصوت للمطورين عبر Gemini API وGoogle AI Studio، تشمل Gemini 3.8 Live وGemini 3.8 Live Extended Thinking للمحادثات الصوتية الفورية، وGemini 3.5 Transcribe لتحويل الكلام المتدفق إلى نص. وتقول الشركة إن النماذج الجديدة موجهة إلى بناء تجارب صوتية لا تكتفي بالرد، بل تستطيع الاستدلال وتنفيذ المهام مع الحفاظ على تدفق الحوار.
وكلاء صوتيون ينفذون المهام أثناء المحادثة
يقدم Gemini 3.8 Live إمكانات صوتية مباشرة من نمط speech-to-speech، بحيث يستطيع الوكيل التعامل مع الطلبات وتنفيذ الإجراءات دون إيقاف المحادثة مؤقتاً. وتتيح ميزة استدعاء الوظائف غير المتزامن تنفيذ استدعاءات واجهات البرمجة والأدوات في الخلفية، مع استمرار بث الرد الصوتي للمستخدم.
كما يمكن للنموذج استخدام مدخلات بصرية حية لتوفير سياق لما يقوله المستخدم وما يراه، والتعامل بدقة مع البيانات الأبجدية الرقمية مثل رموز التأكيد وأرقام المطالبات والبيانات التقنية. وتدعم النماذج أكثر من 97 لغة، مع الحفاظ على اتساق اللهجة، إضافة إلى دمج الصوت الفوري مع تحديثات بيانات منظمة ضمن الرد نفسه.
أما Gemini 3.8 Live Extended Thinking فيضيف خياراً قابلاً للضبط للتفكير في الخلفية عند التعامل مع مسائل معقدة ومتعددة الخطوات. وبحسب Google، يحتل هذا النموذج المرتبة الأولى في لوحة Speech-to-Speech التابعة لـ Artificial Analysis. ولم يوضح الإعلان تفاصيل منهجية التقييم أو المقارنة الكاملة، لذلك تبقى هذه النتيجة مرتبطة بالقياس المذكور في المصدر.
تحويل الكلام إلى نص عبر 85 لغة
أطلقت Google أيضاً Gemini 3.5 Transcribe، وهو نموذج مخصص للتعرف على الكلام بزمن تأخير منخفض. وتذكر الشركة أن النموذج حقق متوسط معدل خطأ كلمات بلغ 4.0% في التحويل المتدفق و2.6% في التحويل غير المتدفق. ويدعم أكثر من 85 لغة، مع إمكان التعامل تلقائياً مع التبديل بين اللغات داخل الجملة أو بين الجمل.
يستطيع المطورون تمرير قائمة مفردات مخصصة تضم ما يصل إلى 1,000 مصطلح لتوجيه التعرف نحو المصطلحات المتخصصة والأسماء غير الشائعة وأسماء الشركات. ويوفر وضع Smart Transcription نصوصاً أكثر جاهزية للقراءة من خلال التنسيق المنظم، وتصحيح بعض الصياغات، وحذف كلمات الحشو والتردد.
ما الذي يتغير عملياً للمطورين؟
تجمع هذه الإتاحة بين الاستماع والتفكير وتنفيذ الأدوات في واجهات صوتية آنية، ما يقلل الحاجة إلى بناء سلسلة منفصلة من نماذج تحويل الكلام إلى نص، ونموذج المحادثة، ومحرك تحويل النص إلى كلام. لكن الإعلان لا يلغي متطلبات البنية التحتية للتدفق الصوتي؛ لذلك تتيح Google الوصول إلى النماذج أيضاً عبر شركاء تكامل مثل Agora وFishjam وLiveKit وLangChain وPipecat وVercel وVision Agents.
تتوفر نماذج Gemini 3.8 Live وGemini 3.8 Live Extended Thinking عبر Live API، بسعر معلن قدره 0.005 دولار لكل دقيقة من إدخال الصوت و0.018 دولار لكل دقيقة من إخراج الصوت. ويشير المصدر في حاشيته إلى أن تقدير التكلفة مبني على 3 دولارات لكل مليون رمز إدخال و12 دولاراً لكل مليون رمز إخراج، ما يستدعي مراجعة المطورين لآلية الفوترة الفعلية قبل التوسع.
يمكن تجربة النماذج عبر ai.studio/live، أو استخدام تطبيقات نموذجية من GitHub، أو الاستفادة من مهارة Live API. وتضم مجموعة الصوت لدى Google كذلك Gemini 3.5 Live Translate للترجمة من كلام إلى كلام بأكثر من 70 لغة، وGemini 3.1 Flash TTS لتوليد الكلام، وLyria 3.5 لتوليد الموسيقى.
كيف أعددنا هذا الخبر؟
اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة،
لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة.
اقرأ سياستنا التحريرية.