الذكاء الاصطناعي

Google تطلق Gemini 3.5 Transcribe للنسخ الصوتي الفوري متعدد اللغات

أعلنت Google عن Gemini 3.5 Transcribe، وهو نموذج لتحويل الكلام إلى نص يستهدف النسخ الفوري والملفات المسجلة مع معالجة الترددات، وتنسيق النص، والتعرف إلى المتحدثين. يتوفر النموذج في معاينة عامة عبر Gemini API ومنصات Google للمطورين والمؤسسات، مع دمجه تدريجياً في تطبيقات Google.

26 أغسطس 2026
4 دقائق قراءة
0 قراءة
فريق تحرير certi.news
Google تطلق Gemini 3.5 Transcribe للنسخ الصوتي الفوري متعدد اللغات

أعلنت Google في 26 أغسطس 2026 عن Gemini 3.5 Transcribe، وهو نموذج جديد لتحويل الكلام إلى نص صُمم للنسخ الصوتي الفوري والتفاعلات الصوتية الذكية. وبدلاً من الاكتفاء بتحويل الصوت الخام إلى كلمات، تقول الشركة إن النموذج ينظف الترددات والتصحيحات الذاتية، ويتعرف إلى المصطلحات المتخصصة، ويخرج نصاً منسقاً أقرب إلى الصيغة الجاهزة للاستخدام.

يستهدف النموذج المطورين الذين يبنون وكلاء صوتيين، وأدوات للترجمة أو التسميات التوضيحية في الوقت الفعلي، وخطوط معالجة لتحليل المكالمات والاجتماعات بعد تسجيلها. وهو متاح عبر Gemini API في Google AI Studio، وكذلك عبر Gemini Enterprise Agent Platform.

واجهتان لاستخدامين مختلفين

تطرح Google النموذج من خلال واجهتين منفصلتين. الأولى هي Live API باستخدام النموذج gemini-3.5-transcribe-live، وتوفر بثاً مستمراً ثنائي الاتجاه بزمن استجابة أقل من ثانية، وهو ما يناسب تطبيقات المحادثة الصوتية التفاعلية. أما الثانية فهي Interactions API باستخدام gemini-3.5-transcribe لمعالجة التسجيلات والاجتماعات وسجلات المكالمات، مع إسناد الكلام إلى المتحدثين وإضافة طوابع زمنية على مستوى الكلمات.

تقول Google إن Gemini 3.5 Transcribe يستطيع التعامل مع التصحيحات الذاتية، مثل تغيير موعد أو كلمة أثناء الحديث، وإزالة كلمات الحشو مثل التمتمة، وتنسيق النص تلقائياً. كما يدعم مفردات مخصصة يمكن تزويده بها للتعرف إلى المصطلحات المتخصصة والتهجئات غير المعتادة، ويدعم اكتشاف ونسخ أكثر من 85 لغة مع التعامل مع اللهجات واللكنات الإقليمية.

في التسجيلات المسجلة، ينسب النموذج الكلام إلى ما يصل إلى ثلاثة متحدثين مع الطوابع الزمنية، بينما لا يزال دعم أكثر من ثلاثة متحدثين تجريبياً. كما يستطيع التعامل مع الانتقال بين اللغات أثناء البث، وهي ميزة مهمة في المحادثات متعددة اللغات، لكن المصدر لا يقدم تفاصيل عن جميع اللغات المدعومة أو حدود الأداء لكل لغة.

أرقام الأداء مقارنةً بـ Chirp 3

وفق قياسات Artificial Analysis التي تستشهد بها Google، حقق النموذج متوسط معدل خطأ كلمات بلغ 4.0% في حالات البث و2.6% في حالات الاستخدام غير المتدفقة. وعلى معيار FLEURS عبر مجموعة من اللغات والمناطق، سجل معدل خطأ كلمات قدره 5.50% في البث و5.04% في الاستخدام غير المتدفق. وتقول الشركة إن زمن الوصول إلى النسخة النهائية تحسن بنسبة 70% مقارنةً بنموذج النسخ السابق Chirp 3.

هذه الأرقام تشير إلى تحسن مزدوج في الدقة والسرعة، لكن المقارنة لا تعني أن النتائج ستكون متطابقة في كل بيئة صوتية؛ فهي تعتمد على المعيار، واللغة، وجودة التسجيل، وعدد المتحدثين، ومستوى الضوضاء. كما أن المصدر لا يوضح منهجية Artificial Analysis بالتفصيل ولا يقدم جدولاً كاملاً للنتائج حسب اللغة.

من واجهات Google إلى أدوات المطورين

تستخدم Google النموذج بالفعل في تطبيق Gemini وبعض تجارب Android، بما في ذلك ميزة Rambler، التي تحول الحديث إلى نص منسق وتتيح إزالة كلمات الحشو وإجراء التصحيحات وتغيير أسلوب الكتابة بالصوت. وفي تطبيق Gemini على macOS، يمكن للأوامر الصوتية الاستفادة من سياق الشاشة لتنفيذ مهام مثل تلخيص الملفات المحلية، وإعادة استخدام النص بين التطبيقات، أو توليد الصور عبر استدعاء نماذج Gemini أخرى.

ويستخدم Google Antigravity سياق الشاشة وسجل المحادثة، بعد الحصول على إذن المستخدم، لتحسين التعرف إلى أسماء الملفات والمستندات النشطة وأفكار الوكيل. كما يمكن الوصول إلى النموذج في وضع Build داخل Google AI Studio لبناء تطبيقات باستخدام الصوت. وتقول Google إن ميزة التحدث للكتابة في أي حقل ويب ستصل قريباً إلى Chrome.

ما الذي يتغير عملياً؟

التحول الأهم هو انتقال النسخ الصوتي من خطوة تفريغ أولية إلى طبقة لفهم الكلام وتنظيفه وربطه بسياق التطبيق. بالنسبة للمطورين، يعني ذلك إمكانية بناء واجهات صوتية لا تتطلب معالجة منفصلة لكل تصحيح أو كلمة حشو، مع خيار استخدام البث الفوري أو التسجيلات المؤرشفة وفق طبيعة المنتج.

يتوفر Gemini 3.5 Transcribe حالياً في معاينة عامة للمطورين عبر Gemini API في Google AI Studio وGoogle Antigravity، وللمؤسسات عبر Gemini Enterprise Agent Platform، على أن يصل لاحقاً إلى Gemini Enterprise for Customer Experience. وللمستخدمين، يتوفر في تطبيق Gemini على macOS باللغة الإنجليزية، بينما تتاح Rambler على Android في دول ولغات محددة، مع وصول مرتقب إلى Chrome.

مصدر الخبر
كيف أعددنا هذا الخبر؟

اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة، لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة. اقرأ سياستنا التحريرية.

ف
كاتب المقال

فريق تحرير certi.news

فريق التحرير

فريق تحرير certi.news يتابع المصادر التقنية ويعيد بناء الأخبار بالعربية مع مراجعة الحقائق والسياق قبل النشر.

من نفس التصنيف

مقالات قد تهمك

عرض جميع المقالات