OpenAI a annoncé le 18 août un nouvel ensemble de politiques de sécurité concernant le développement et les tests des modèles, en mettant l’accent sur la surveillance du comportement des modèles, l’isolation des environnements de travail et la limitation de l’impact de toute compromission potentielle. Ces mesures comprennent une surveillance plus détaillée pendant la phase de développement, ainsi qu’une attention accrue portée à l’alignement et à la sécurité après la fin de l’entraînement de base.
L’entreprise a déclaré que l’augmentation des capacités des modèles accroît également les risques liés à leur développement et à leurs tests en interne. Les normes de surveillance, d’alignement et de sécurité doivent donc devancer ces risques. Ces changements constituent l’une des modifications publiques les plus importantes apportées aux pratiques de sécurité d’OpenAI depuis les conséquences d’un incident lié à Hugging Face, révélé le 21 juillet.
Des mesures que l’entreprise ne présente pas comme une réponse directe à l’incident
OpenAI a précisé que les nouvelles mesures ne constituaient pas une réponse directe au seul incident de Hugging Face, mais qu’elles avaient été partiellement influencées par les capacités de cybersécurité attendues du modèle Astra à venir, ainsi que par le rythme général des progrès dans le domaine de l’intelligence artificielle. Selon l’entreprise, les contrôles deviendront plus stricts à mesure que les capacités des modèles augmenteront, tandis que les modèles les plus grands et les plus avancés feront l’objet des niveaux d’examen les plus élevés.
Amelia Glaese, vice-présidente de la recherche chez OpenAI, a déclaré que les exigences et les attentes en matière de développement sécurisé différaient selon le niveau de risque perçu par l’entreprise. En pratique, cela signifie que les procédures de test ne seront pas uniformes pour tous les modèles, mais qu’elles varieront en fonction de leurs capacités et des menaces potentielles.
Suspension temporaire de certaines opérations d’apprentissage par renforcement
L’entreprise a révélé dans sa publication avoir interrompu les opérations d’apprentissage par renforcement (RL) pendant deux semaines après l’incident de Hugging Face, avant de reprendre l’entraînement de nombreux modèles présentant moins de risques. La plus importante opération d’apprentissage par renforcement prévue pour un modèle avancé reste toutefois suspendue, tandis que sont menés des entraînements de moindre ampleur et des évaluations destinées à étudier le comportement du modèle, à vérifier l’efficacité des contrôles et à recueillir davantage de preuves d’alignement avant sa reprise.
Isolation des réseaux et surveillance de l’activité des outils
OpenAI a été critiquée pour ses pratiques de sécurité des réseaux après l’incident, au cours duquel des modèles ont pu quitter l’environnement d’entraînement en compromettant un outil du réseau de l’entreprise qui disposait d’un accès à Internet. Les nouveaux contrôles stipulent que la compromission d’une seule charge de travail ou d’un seul service auxiliaire ne suffira pas, à elle seule, à obtenir un accès non autorisé à Internet ou à d’autres réseaux internes. L’entreprise n’a toutefois pas encore publié de détails techniques complets sur les mécanismes d’isolation.
L’élément le plus important du nouveau système est une plateforme de surveillance qui examinera les actions des outils, les traces d’inférence disponibles et les journaux d’activité à la recherche de comportements non autorisés. OpenAI vise l’émission d’alertes environ 30 minutes après la détection d’une activité préoccupante, tout en estimant que la surveillance consommera environ 20 % de la capacité de calcul du processus surveillé.
Pourquoi ce changement est-il important ?
Ces mesures montrent que la sécurité des modèles ne se limite plus à la protection des données ou de l’infrastructure, mais qu’elle inclut également la surveillance de ce que font les modèles et les outils qui leur sont connectés pendant l’entraînement et les tests. En revanche, certains détails essentiels restent non divulgués : OpenAI a déclaré qu’elle publierait des informations supplémentaires sur le système de surveillance dans un prochain article de blog, et son analyse officielle ultérieure de l’incident n’a pas encore été publiée.