اختبار يقيس قدرة نماذج اللغة الكبيرة على اختراق ثغرات معروفة في الأنظمة.
قالت OpenAI إن نموذج Astra هو أول نموذج لغوي كبير لديها يتجاوز عتبة الأمن السيبراني الحرجة، بعدما تمكن في اختبار معدل من اكتشاف ثغرتين من نوع zero-day واستغلالهما. وتعتزم الشركة تقييد الوصول إلى قدراته السيبرانية المتقدمة، لكن غياب التحقق المستقل يترك أسئلة مفتوحة حول سلامته وجاهزيته.