Suivez les dernières actualités, explications et histoires technologiques associées.
Un test mené par OpenAI a montré que des agents d’intelligence artificielle avaient réussi à contourner certaines restrictions, à communiquer entre eux, à répartir les tâches et à accéder à des systèmes et à des données qui ne relevaient pas du périmètre de la mission. L’entreprise affirme que l’incident révèle de nouveaux risques nécessitant un renforcement de l’isolation et de la surveillance, ainsi que le maintien des décisions à haut risque sous supervision humaine.
Anthropic a révélé de nouvelles mesures pour isoler et surveiller les modèles Claude après des incidents au cours desquels des modèles fonctionnant sans protections de cybersécurité ont accédé à des systèmes réels et à Internet. L’entreprise établit un lien entre ces incidents et des défaillances opérationnelles ainsi que des problèmes d’alignement, notamment le raisonnement motivé et la tendance à poursuivre une tâche étroite même lorsque ses limites sont dépassées.