الذكاء الاصطناعي

مايكروسوفت تعلن عن MAI-Transcribe-1 وMAI-Voice-1 ضمن Azure Speech في Foundry Tools

تقدم مايكروسوفت Azure Speech في إطار Foundry Tools لبناء تطبيقات ووكلاء صوتيين متعددَي اللغات، مع إمكانات لتحويل الكلام إلى نص، وتحويل النص إلى كلام، والترجمة والتعرف على المتحدث. وتشير الصفحة أيضاً إلى MAI-Transcribe-1 وMAI-Voice-1، وإلى دعم النشر السحابي أو عند الحافة وخيارات الاستخدام المضمنة على الجهاز.

15 أغسطس 2026
4 دقائق قراءة
0 قراءة
مايكروسوفت تعلن عن MAI-Transcribe-1 وMAI-Voice-1 ضمن Azure Speech في Foundry Tools

أعلنت مايكروسوفت عن MAI-Transcribe-1 وMAI-Voice-1 ضمن Azure Speech، الذي أصبح جزءاً من مجموعة Foundry Tools المخصصة لبناء تطبيقات الذكاء الاصطناعي والوكلاء القادرين على التفاعل صوتياً. وتجمع الخدمة بين نماذج صوتية جاهزة قابلة للتخصيص ودعم متعدد اللغات، بهدف تمكين المطورين من إضافة الإدخال والإخراج الصوتي إلى تطبيقاتهم.

كانت الخدمة تُعرف سابقاً باسم Azure AI Speech، وتوفر واجهات برمجة لتقنيات تحويل الكلام إلى نص، وتحويل النص إلى كلام، والترجمة الصوتية، والتعرف على المتحدث. وتوضح مايكروسوفت أن إعادة التسمية إلى Foundry Tools تعكس توحيداً أوسع للمنصة، ووضع هذه الخدمات كأدوات أساسية لبناء تطبيقات ووكلاء ذكاء اصطناعي. وتقول الشركة إن القدرات الأساسية للخدمة لم تتغير، لكن دمجها في منظومة Foundry يهدف إلى تسهيل اكتشافها وتنسيقها وربطها بسير عمل الذكاء الاصطناعي الحديثة.

قدرات صوتية للتطبيقات والوكلاء

تتيح Azure Speech للمطورين بناء وكلاء صوتيين باستخدام نماذج أساسية إلى جانب نماذج مخصصة لمعالجة الصوت الوارد والصادر. كما تدعم الخدمة نسخ المحادثات في مراكز الاتصال والاجتماعات، مع توفير ميزة التعليق الصوتي بأكثر من 100 لغة، وفقاً للصفحة.

وتشمل الاستخدامات الأخرى إنشاء روبوتات تتحدث بأصوات طبيعية، وتخصيص الأصوات العصبية لتطوير هوية صوتية للعلامات التجارية، وبناء صور رمزية جاهزة أو مخصصة بأصوات طبيعية. كما يمكن ترجمة البيانات الصوتية أو المرئية من لغات متعددة وإليها، مع تخصيص الترجمة لتناسب قطاعات معينة.

وتتضمن المنصة إمكانات للتحليلات اللاحقة للمكالمات، إذ يمكن تحليل تسجيلات المكالمات الصوتية أو المرئية باستخدام النماذج الأساسية في Azure Content Understanding ضمن Foundry Tools. كما تتيح استخدام أحدث نموذج OpenAI Whisper في Azure Speech أو Azure OpenAI في Foundry Models لنسخ الصوت، إلى جانب دعم بناء واجهات محادثة وتلخيص المستندات وتحليل النصوص عبر خدمات Azure الأخرى.

الترجمة والتشغيل عند الحافة

تقدم Voice Live API إمكانات من البداية إلى النهاية للصوت، بما في ذلك النسخ المخصص والترجمة الصوتية والصور الرمزية. وتدعم الخدمة الترجمة الفورية من الكلام إلى الكلام، وكذلك تحويل الكلام إلى نص لتدفقات الصوت متعددة اللغات.

كما يمكن تشغيل النماذج في المكان الذي توجد فيه البيانات، سواء عبر السحابة أو عند الحافة باستخدام الحاويات. وتوفر ميزة Embedded Speech سيناريوهات تحويل الكلام إلى نص وتحويل النص إلى كلام على الجهاز، وهو ما يستهدف الحالات التي يكون فيها الاتصال بالسحابة متقطعاً أو غير متاح.

التسعير وطرق التطوير

تعتمد Azure Speech نموذج الدفع حسب الاستخدام، من دون تكاليف مسبقة، وتُحتسب الرسوم وفقاً لعدد ساعات الصوت التي تتم معالجتها أو ترجمتها في مهام تحويل الكلام إلى نص والترجمة الصوتية، وعدد الأحرف التي تُحوّل إلى صوت في مهام تحويل النص إلى كلام، إضافة إلى عدد معاملات التعرف على المتحدث.

تتوفر الخدمة عبر حزم تطوير برمجية لعدة لغات، من بينها C# وC++ وJava. ويمكن للمطورين البدء من خلال Azure أو Microsoft Foundry، والوصول إلى الوثائق والبرامج التعليمية وواجهات برمجة التطبيقات، فضلاً عن أمثلة برمجية متاحة عبر GitHub. كما يمكن دمج Azure Speech مع Azure OpenAI وAzure Translator وAzure Language وAzure Content Understanding وContent Safety في Foundry Control Plane.

الأمان والتكامل مع خدمات Azure

تذكر مايكروسوفت أن Azure يوفر أكثر من 100 شهادة امتثال، من بينها أكثر من 50 شهادة مرتبطة بمناطق ودول محددة. كما تشير الصفحة إلى وجود 34,000 مهندس بدوام مكافئ مخصصين لمبادرات الأمان، و15,000 شريك يمتلكون خبرات متخصصة في هذا المجال.

وتستهدف Azure Speech تطبيقات الذكاء الاصطناعي التوليدي متعددة الوسائط، ومراكز الاتصال، والتحليلات اللاحقة للمكالمات، وتلخيص الفيديو، والتواصل متعدد اللغات. ويمكن للمستخدمين اختيار حساب Azure للدفع حسب الاستخدام أو تجربة Azure مجاناً لمدة تصل إلى 30 يوماً، وفقاً للمعلومات الواردة في الصفحة.

من نفس التصنيف

مقالات قد تهمك

عرض جميع المقالات