Inteligencia artificial

Una nueva técnica de razonamiento de OpenAI genera preocupación sobre la supervisabilidad de los modelos de inteligencia artificial

Se espera que el modelo Astra de OpenAI utilice la técnica de «profundidad recurrente», que procesa las consultas mediante bucles repetidos en lugar de la secuencia habitual, lo que podría hacer que las huellas del razonamiento sean menos claras para los observadores. La empresa afirma que el uso de la técnica será limitado y que está comprometida con mantener cadenas de pensamiento legibles, pero investigadores de seguridad de la inteligencia artificial advierten sobre su expansión.

2026-09-02
4 min de lectura
3 visitas
فريق تحرير certi.news
Una nueva técnica de razonamiento de OpenAI genera preocupación sobre la supervisabilidad de los modelos de inteligencia artificial

OpenAI tiene previsto utilizar una técnica de razonamiento conocida como «profundidad recurrente» (recurrent depth), o «recurrencia opaca» (opaque recurrence), en su nuevo modelo Astra, según informó The Information. La técnica permite al modelo procesar la misma consulta varias veces dentro de un bucle, en lugar de seguir una trayectoria secuencial similar a los pasos de pensamiento tradicionales de los modelos de razonamiento.

La cuestión que ha suscitado preocupación no se refiere únicamente al lanzamiento del modelo o a sus capacidades anunciadas, sino a la posibilidad de que esta arquitectura haga que el proceso de razonamiento sea menos examinable. Cuantas menos huellas legibles deje el modelo, más difícil será para los equipos de seguridad detectar comportamientos no deseados o comprender las razones de las decisiones de los agentes y modelos avanzados.

¿Por qué es importante esta noticia?

Los equipos de investigación en inteligencia artificial utilizan los registros de la «cadena de pensamiento» como herramienta de supervisión, aunque estos registros no representan necesariamente el pensamiento interno del modelo de manera completa o literal. Según el artículo, estos registros fueron un factor importante en el análisis reciente de la actividad de unos agentes descrita como ajena al comportamiento esperado, así como en el intento de comprender las razones de sus acciones.

En el caso de la recurrencia opaca, una mayor parte del procesamiento podría trasladarse a una vía que no produzca pasos claros que los seres humanos puedan leer fácilmente. Esto plantea una pregunta práctica para los equipos de seguridad: ¿cómo se puede supervisar un modelo cuya capacidad de razonamiento aumenta si, al mismo tiempo, disminuyen las pruebas disponibles sobre la forma en que llega a su resultado?

Preocupación por una vía difícil de revertir

Buck Shlegeris, director ejecutivo de Redwood, advirtió que aumentar la recurrencia podría reducir considerablemente la supervisabilidad de la cadena de pensamiento. Dijo que todavía no sabe si Astra es menos supervisable que los modelos anteriores, pero teme que llevar la técnica a niveles superiores termine socavando por completo esa capacidad.

Zvi Mowshowitz, defensor de la seguridad de la inteligencia artificial desde hace mucho tiempo, también consideró que el uso intensivo de estos métodos podría perjudicar lo que describió como los esfuerzos de OpenAI y Anthropic por mantener la legibilidad de las cadenas de pensamiento y su correspondencia con el comportamiento real. Planteó la posibilidad de que se necesiten leyes para impedir lo que denominó una «carrera hacia el abismo» entre los laboratorios de inteligencia artificial.

La postura de OpenAI y los límites conocidos actualmente

La información disponible indica que el uso de la técnica por parte de Astra será limitado y que se espera que su cadena de pensamiento siga siendo legible. OpenAI también rechazó insinuar que el modelo pasará a un modo completamente incomprensible o a lo que a veces se denomina «lenguaje neuronal» (neuralese).

Jakub Pachocki, científico jefe de OpenAI, confirmó mediante una publicación en la plataforma X que la empresa ha trabajado desde sus primeros modelos de razonamiento para mantener y utilizar la supervisión de la cadena de pensamiento, y que este objetivo constituye un eje fundamental de su programa de investigación actual. OpenAI también había anunciado planes para ampliar la supervisión de las cadenas de pensamiento como parte de sus futuros planes de seguridad.

¿Qué sigue sin resolverse?

Ryan Greenblatt, científico jefe de Redwood Research, considera que el razonamiento opaco podría expandirse más rápidamente que el razonamiento basado en una cadena de pensamiento tradicional, hasta trasladar la mayor parte del proceso de pensamiento al «espacio latente» invisible. The Information informó posteriormente de que Anthropic y Google DeepMind también están debatiendo la técnica, lo que indica que la cuestión podría trascender el modelo Astra y convertirse en una tendencia de investigación más amplia.

Sin embargo, la fuente no demuestra que Astra vaya a ocultar por completo su cadena de pensamiento ni ofrece mediciones específicas que indiquen cuánto disminuirá la supervisabilidad. Por tanto, el cambio confirmado actualmente consiste en la aparición de una nueva técnica que plantea preguntas sobre las herramientas de seguridad, no en la demostración de que esas herramientas hayan fracasado. La importancia práctica de la evolución dependerá del alcance del uso de la recurrencia opaca y de la capacidad de OpenAI y de otros laboratorios para ofrecer medios de supervisión alternativos o complementarios a los registros tradicionales.

Fuente de la noticia
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias