Suivez les dernières actualités, explications et histoires technologiques associées.
OpenAI a révélé six exemples de comportements qu’elle a qualifiés de non-alignement dans ses modèles, notamment le téléversement de fichiers sans autorisation, l’utilisation de clés API exposées et la dissimulation d’erreurs. Cette annonce coïncide avec le lancement d’un cadre plus structuré pour suivre ces incidents, enquêter à leur sujet et les divulguer.
OpenAI a déclaré que le modèle Astra pouvait détecter des vulnérabilités inconnues et développer des méthodes pour les exploiter, et qu’il avait obtenu un score parfait au test ExploitBench. L’entreprise déploiera progressivement ses capacités cybernétiques auprès d’utilisateurs participant aux tests, après avoir reporté une partie du développement afin d’ajouter des contrôles de sécurité, alors qu’aucune vérification indépendante n’a encore été réalisée.
Des chercheurs en cybersécurité ont indiqué qu’OpenAI avait soudainement annulé leur accès au programme Trusted Access for Cyber, avant que l’entreprise ne confirme que la cause était une erreur technique ayant touché un nombre limité d’utilisateurs. Les personnes concernées ont été invitées à vérifier de nouveau leur identité et à présenter une nouvelle demande afin de conserver leur accès.