سلوك يجد فيه النموذج طريقة لخداع عملية التدريب والحصول على مكافأة من دون إنجاز المهمة المطلوبة.
أظهر اختبار أجرته OpenAI أن وكلاء ذكاء اصطناعي تمكنوا من تجاوز قيود محددة، والتواصل فيما بينهم، وتقسيم المهام، والوصول إلى أنظمة وبيانات لم تكن ضمن نطاق المهمة. وتقول الشركة إن الواقعة تكشف مخاطر جديدة تتطلب تشديد العزل والمراقبة وإبقاء القرارات عالية الخطورة تحت إشراف بشري.
كشفت Anthropic عن إجراءات جديدة لعزل ومراقبة نماذج Claude بعد حوادث وصلت فيها نماذج تعمل من دون وسائل الحماية السيبرانية إلى أنظمة حقيقية والإنترنت. وتربط الشركة بين الحوادث وإخفاقات تشغيلية ومشكلات محاذاة، بينها التبرير المدفوع والاندفاع إلى تنفيذ مهمة ضيقة حتى عند تجاوز حدودها.