تعمل شركة Circuit Breaker Labs على بناء طبقة اختبار للذكاء الاصطناعي تركز على المخاطر النفسية التي قد تظهر أثناء التفاعلات الطبيعية مع المستخدمين، لا على محاولات كسر النظام بأساليب عدائية فقط. وتستخدم الشركة وكلاء محاكاة تصفهم بأنهم أشبه بـ«دمى اختبار اصطدام» رقمية، لتمثيل مستخدمين من أعمار وخلفيات ولغات وثقافات مختلفة.
تأتي الفكرة في وقت تواجه فيه شركات الذكاء الاصطناعي دعاوى تتعلق بتأثير روبوتات المحادثة في مستخدمين قُصّر يعانون أزمات نفسية أو أفكاراً انتحارية. ويقول مؤسسا الشركة، الشقيقان Shirali Nigam وArul Nigam، إن بعض مواطن الخطر لا تظهر عندما يحاول المستخدم التحايل على النظام، بل عندما يستخدمه بطريقة عادية ويُساء فهم كلامه أو سياقه.
اختبار اللغة كما يستخدمها الناس فعلياً
تعتمد Circuit Breaker Labs على خبراء بشريين لبناء محاكاة مستخدمين تتضمن أنماط الكلام الواقعية، والعبارات العامية، واللغة المشفرة، والأخطاء الإملائية، والفروق بين المتحدث الأصلي للغة والمتحدث بها كلغة ثانية. وترى الشركة أن النموذج قد يتعامل جيداً مع اللغة القياسية، لكنه قد يخطئ في فهم تعبير قصير أو مصطلح عامي عندما يتراكم السياق عبر محادثات متعددة.
وتجري المنصة اختبارات «فريق أحمر» مصممة لكشف نقاط الضعف، بما يتراوح بين عشرات الآلاف ومئات الآلاف من التفاعلات المحاكاة يومياً. بعد ذلك تستخدم الشركة آلية تسجيل خاصة لإنتاج درجات تقول إنها قابلة للتدقيق وقابلة للتفسير.
ما الذي يتغير عملياً؟
بدلاً من الاكتفاء بفحص ردود منفردة، تحاول المنصة اختبار ما إذا كان النموذج سيستجيب بصورة مناسبة لتفاعل خطر يتطور تدريجياً عبر عدة محادثات. وهذا مهم خصوصاً في تطبيقات التدريب بالذكاء الاصطناعي، وتدوين اليوميات، والدعم النفسي، حيث قد يلجأ المستخدم إلى النظام طلباً للمساندة لا بهدف اختبار حدوده.
وتقول الشركة إن نطاق المنصة يمكن أن يمتد لاحقاً إلى وكلاء «زملاء العمل» وغيرهم من التطبيقات التي قد تنشئ علاقة شبه اجتماعية بين المستخدم وبرنامج المحادثة. لكن هذا التوسع ما زال تصوراً مستقبلياً، إذ تعمل Circuit Breaker Labs حالياً كمختبر اختبار لتطبيقات الذكاء الاصطناعي عالية المخاطر، ولم تكشف أسماء عملائها الرئيسيين.
المرحلة الحالية والقيود
لدى الشركة منتج عامل، لكنها لا تزال في مرحلة مبكرة جداً، ويبلغ عدد موظفيها خمسة فقط، بمن فيهم الشقيقان Nigam. كما أن المادة لا تقدم تفاصيل عن منهجية التسجيل الخاصة، أو نتائج مقارنة مستقلة، أو أسماء العملاء، ما يجعل تقييم فعالية المنصة خارج وصف الشركة محدوداً في الوقت الحالي.
قراءة certi.news: تكشف المبادرة عن تحول مهم في اختبار سلامة النماذج: الخطر قد ينتج من سوء فهم اللهجة أو العمر أو السياق الثقافي، وليس فقط من طلب ضار واضح. قيمة هذا النهج ستعتمد على مدى واقعية المحاكاة، وقدرته على اكتشاف الأذى عبر الزمن، وشفافية الدرجات التي ينتجها. أما تصريحات الشركة حول بناء الثقة فلا تكفي وحدها لإثبات تحسن السلامة؛ المطلوب لاحقاً بيانات قابلة للتحقق ونتائج من عملاء أو جهات مستقلة.
كيف أعددنا هذا الخبر؟
اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة،
لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة.
اقرأ سياستنا التحريرية.