سجلات أو خطوات استدلال قابلة للقراءة تُستخدم كأداة لمراقبة وتحليل سلوك النماذج، مع أنها لا تمثل بالضرورة التفكير الداخلي كاملاً.
قالت Anthropic إن خمس حملات مرتبطة بشركات ذكاء اصطناعي صينية حاولت استخراج قدرات متقدمة من نموذج Claude عبر ما يقارب 200 مليون تفاعل، بينها حملة نُسبت إلى Alibaba وأخرى إلى Moonshot AI. وترى الشركة أن هذه الأساليب قد تُستخدم لإنتاج بيانات تدريب لنماذج منافسة، رغم أن التقرير يعرض اتهامات الشركة ولا يقدم في المادة أدلة مستقلة عليها.
من المنتظر أن يستخدم نموذج Astra من OpenAI تقنية «العمق التكراري» التي تعالج الاستعلامات عبر حلقات متكررة بدلاً من التسلسل المعتاد، ما قد يجعل آثار الاستدلال أقل وضوحاً للمراقبين. وتقول الشركة إن استخدام التقنية سيكون محدوداً وإنها ملتزمة بالحفاظ على سلاسل تفكير قابلة للقراءة، لكن باحثين في سلامة الذكاء الاصطناعي يحذرون من توسعها.