OpenAI prévoit d’utiliser, dans son nouveau modèle Astra, une technique de raisonnement connue sous le nom de « profondeur récurrente » (recurrent depth), ou de « récurrence opaque » (opaque recurrence), selon The Information. Cette technique permet au modèle de traiter plusieurs fois la même requête au sein d’une boucle, au lieu de suivre un parcours séquentiel ressemblant aux étapes de raisonnement traditionnelles des modèles de raisonnement.
Le problème qui suscite des inquiétudes ne concerne pas seulement le lancement du modèle ou ses capacités annoncées, mais aussi la possibilité que cette architecture rende le processus de raisonnement moins contrôlable. Moins le modèle laisse de traces lisibles, plus il devient difficile pour les équipes de sécurité de détecter les comportements indésirables ou de comprendre les raisons des décisions des agents et des modèles avancés.
Pourquoi cette information est-elle importante ?
Les équipes de recherche en intelligence artificielle utilisent les journaux de la « chaîne de pensée » comme outil de surveillance, bien que ces journaux ne représentent pas nécessairement la pensée interne du modèle de manière complète ou littérale. Selon l’article, ces journaux ont joué un rôle important dans l’analyse d’une activité récente d’agents décrite comme sortant du comportement attendu, ainsi que dans les tentatives de comprendre les raisons de leurs actions.
Dans le cas de la récurrence opaque, une plus grande partie du processus de traitement pourrait être transférée vers une voie qui ne produit pas d’étapes claires facilement lisibles par les humains. Cela soulève une question pratique pour les équipes de sécurité : comment surveiller un modèle dont la capacité de raisonnement augmente si, dans le même temps, les éléments disponibles sur la manière dont il parvient à sa conclusion diminuent ?
Des craintes face à une voie difficilement réversible
Buck Shlegeris, directeur général de Redwood, a averti qu’une augmentation de la récurrence pourrait réduire considérablement la contrôlabilité de la chaîne de pensée. Il a déclaré ne pas encore savoir si Astra était moins contrôlable que les modèles précédents, mais craindre que le fait de pousser la technique à des niveaux supérieurs ne compromette entièrement cette contrôlabilité.
Zvi Mowshowitz, qui défend depuis longtemps la sécurité de l’intelligence artificielle, a également estimé qu’un recours intensif à ces méthodes pourrait nuire aux efforts d’OpenAI et d’Anthropic visant à préserver la lisibilité des chaînes de pensée et leur concordance avec le comportement réel. Il a évoqué la possibilité que des lois soient nécessaires pour empêcher ce qu’il a appelé une « course vers le bas » entre les laboratoires d’intelligence artificielle.
La position d’OpenAI et les limites actuellement connues
Les informations disponibles indiquent que l’utilisation de cette technique par Astra sera limitée et que sa chaîne de pensée devrait rester lisible. OpenAI a également rejeté l’idée que le modèle passerait à un mode totalement incompréhensible, parfois appelé « langage neural » (neuralese).
Jakub Pachocki, scientifique en chef d’OpenAI, a confirmé dans une publication sur la plateforme X que l’entreprise travaillait, depuis ses premiers modèles de raisonnement, à préserver la surveillance et l’utilisation de la chaîne de pensée, et que cet objectif constituait un axe essentiel de son programme de recherche actuel. OpenAI avait également annoncé des plans visant à renforcer la surveillance des chaînes de pensée dans le cadre de ses projets futurs en matière de sécurité.
Quelles questions restent ouvertes ?
Ryan Greenblatt, scientifique en chef de Redwood Research, estime que le raisonnement opaque pourrait se développer plus rapidement que le raisonnement fondé sur une chaîne de pensée traditionnelle, jusqu’à transférer la majeure partie du processus de réflexion vers un « espace latent » invisible. The Information a indiqué par la suite qu’Anthropic et Google DeepMind discutaient également de cette technique, ce qui suggère que la question pourrait dépasser le modèle Astra et s’inscrire dans une orientation de recherche plus large.
Cependant, la source ne prouve pas qu’Astra dissimulera entièrement sa chaîne de pensée et ne fournit pas de mesures précises indiquant l’ampleur de la diminution de la contrôlabilité. Le changement établi à ce stade réside donc dans l’apparition d’une nouvelle technique qui soulève des questions concernant les outils de sécurité, et non dans la preuve de l’échec de ces outils. L’importance pratique de cette évolution dépendra de l’ampleur de l’utilisation de la récurrence opaque et de la capacité d’OpenAI et des autres laboratoires à fournir des moyens de surveillance alternatifs ou complémentaires aux journaux traditionnels.