أنشأت شركة Synthesia نسخة رقمية تفاعلية من صحفية TechCrunch Dominic-Madori Davis، بعد التقاط صور متعددة لها وتسجيل دقيقتين من صوتها. لم تكن النتيجة مجرد صورة تتلو نصاً مكتوباً، بل Avatar يستمع إلى الأسئلة ويحوّلها إلى نص، ثم يستخدم نموذجاً لغوياً لصياغة الرد، ويحوّل الإجابة إلى صوت، بينما يحرك نموذج فيديو ملامح الشخصية أثناء الكلام.
اختارت الصحفية تدريب النسخة التفاعلية على قصة كتبتها عن أسباب زيادة حالات الاحتيال في الشركات الناشئة المدعومة برأس المال الجريء مقارنة بغير المدعومة منه. لذلك كان التوأم “حتمياً”؛ أي إنه لا يجيب إلا ضمن النطاق الذي أُعد له، ويعيد توجيه الأسئلة الخارجة عنه إلى القصة الأصلية.
كيف بُني التوأم الرقمي؟
احتاج فريق Synthesia إلى بضعة أيام لإنشاء النماذج. وحصلت الصحفية على نسخ شخصية تقرأ النصوص التي تقدمها، ونسخ تفاعلية يمكنها الاستماع والرد، مع خيارات بوجود النظارات أو من دونها. وتستخدم المنظومة نماذج Synthesia للفيديو والصوت، مع إتاحة اختيار نماذج بديلة من Cartesia وElevenLabs وGoogle وOpenAI، إضافة إلى خيارات لاستضافة التوأم على السحابة التي يختارها العميل أو لدى Synthesia.
تضع الشركة هذه الإمكانات ضمن ثلاث فئات رئيسية: منصة لإنشاء وتوزيع الفيديو باستخدام Avatars تقليدية، ومنصة Sessions التفاعلية للاستطلاعات وتمارين المحاكاة، وواجهة API تتيح دمج نماذج الصوت والفيديو مع خدمات أخرى لبناء Avatars تفاعلية أو منتجات مختلفة.
ما الذي تكشفه التجربة؟
وجدت الصحفية أن الصوت قريب من صوتها في النسخة الشخصية، لكن أصدقاءها رأوا أن التشابه في النسخة التفاعلية أقل إقناعاً. ومع ذلك، كان الحضور كافياً لإنتاج شعور بالغرابة، حتى إن والديها حاولا طرح أسئلة شخصية لا يعرف إجاباتها إلا أفراد العائلة، من دون أن يحصلوا على رد بسبب القيود التي فرضها التدريب.
توضح هذه النتيجة فرقاً مهماً بين Avatar مضبوط النطاق ونسخة مدفوعة بنموذج محادثة مفتوح. الأول قابل للتوقع نسبياً، لكنه محدود الفائدة خارج المادة التي دُرب عليها. أما الثاني فقد يبدو أكثر مرونة، لكنه يفتح مجالاً لإجابات مختلقة أو سلوكيات يصعب ضبطها.
لماذا يهم هذا الخبر؟
ترى الكاتبة أن الاستخدام المحتمل في الصحافة هو السؤال الأهم: هل يقبل الجمهور أن تقدم الأخبار شخصية رقمية؟ وهل يمكن أن يحل Avatar محل الصحفي أو يتيح للرؤساء التنفيذيين التحدث إلى نسخة رقمية من الصحفي بدلاً من الشخص نفسه؟ موقفها واضح في نقطة أساسية: جوهر الصحافة هو الثقة، وهي لا ترى أن هذا العنصر يمكن تفويضه بسهولة إلى الذكاء الاصطناعي.
خارج الإعلام، قد تكون الفكرة أكثر جاذبية للشركات والأفراد؛ إذ يمكن لنسخة رقمية أن تجيب عن الأسئلة أثناء غياب صاحبها أو تساعد في التدريب وخدمة الموظفين والعملاء. لكن التجربة لا تثبت أن هذه النماذج جاهزة لاستبدال البشر، بل تبيّن أن التحكم في نطاق الإجابة والموافقة على استخدام الصوت والصورة يظلان جزءاً مركزياً من تصميمها.
وتبقى أسئلة الاستخدام الأوسع مفتوحة: متى يعرف الجمهور أنه يتحدث إلى نسخة اصطناعية؟ من يتحمل مسؤولية إجابة خاطئة؟ وما الحدود التي تمنع تحول التوأم الرقمي من واجهة عملية إلى شخصية توهم المستخدم باستقلالية أو معرفة لا يملكها؟ هذه أسئلة تستند إلى طبيعة التجربة نفسها، لا إلى وعد بأن التقنية ستتطور حتماً في اتجاه معين.
كيف أعددنا هذا الخبر؟
اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة،
لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة.
اقرأ سياستنا التحريرية.