اختبارات تقييم مستقلة وغير معلنة مسبقاً لتقليل قدرة المختبرات على تحسين النماذج وفق اختبارات معروفة.
أطلقت Google وGoogle DeepMind معهداً جديداً يضم آراء وأبحاثاً حول الذكاء الاصطناعي العام، وبدأ أعماله بأربع مقالات تتناول الشفافية، والسياسات الاقتصادية، ورفاه الإنسان، وتقييم النماذج المتقدمة. وتطرح إحدى المقالات إطاراً أميركياً لتقييم نماذج الذكاء الاصطناعي الرائدة قبل إطلاقها.