Inteligencia artificial

Una investigación de Anthropic prueba sistemas de inteligencia artificial para mejorar la alineación de los modelos

Un artículo de investigación de Anthropic mostró que unos sistemas automatizados lograron mejorar el rendimiento de un modelo en 10 pruebas de comportamientos incompatibles con los objetivos de alineación, sin que disminuyera su rendimiento general. Los primeros resultados apuntan a la posibilidad de automatizar parte de la investigación sobre alineación, aunque la calidad de los criterios y de los datos de investigación sigue siendo una limitación fundamental.

2026-08-28
5 min de lectura
5 visitas
فريق تحرير certi.news
Una investigación de Anthropic prueba sistemas de inteligencia artificial para mejorar la alineación de los modelos

Anthropic publicó un artículo de investigación titulado Automated Researchers Can Reliably Mitigate Alignment Failures, en el que presenta un experimento que utilizó sistemas de inteligencia artificial automatizados para mejorar el rendimiento de un modelo en pruebas que miden comportamientos específicos incompatibles con los objetivos de alineación. Según el artículo, los sistemas lograron elevar el rendimiento en las diez pruebas, sin perjudicar el rendimiento general del modelo.

La investigación está dirigida por Chen Yueh-Han, miembro del programa de Anthropic, mientras que el sistema imita algo parecido al ciclo de investigación tradicional: busca en la bibliografía disponible, propone un método para mejorar el modelo y después lo entrena mediante el método propuesto durante 30 minutos. Tras cada ronda, los métodos eficaces pasan a etapas posteriores, mientras que los ineficaces se descartan, lo que permite repetir los experimentos con rapidez y a gran escala.

¿Qué cambió en la práctica?

El valor principal del experimento no reside simplemente en utilizar un modelo para entrenar otro, sino en trasladar parte del propio proceso de investigación a un sistema automatizado. En lugar de limitarse a ejecutar instrucciones establecidas por el investigador, la inteligencia artificial intenta identificar líneas de investigación, probarlas y conservar las que demuestran su eficacia.

El artículo afirma que estos resultados ofrecen indicios tempranos de que la investigación automatizada sobre la alineación después del entrenamiento podría convertirse en una práctica viable a corto plazo. Esto se refiere al desarrollo del comportamiento del modelo después de la etapa de entrenamiento básico con el objetivo de reducir los casos en que no se ajusta a los objetivos establecidos para él, basándose en criterios de evaluación y métodos de entrenamiento reproducibles.

Comparación directa con la investigación humana

El artículo va más allá de mostrar una mejora en los resultados de las pruebas, ya que compara lo que denomina Automated Alignment Researcher, o AAR, con el investigador humano. Según los resultados que presenta, el mejor método propuesto por un sistema AAR superó, en promedio durante seis horas, lo propuesto por investigadores humanos experimentados; también señaló que las líneas de investigación orientadas por humanos no produjeron un rendimiento superior.

La comparación también incluye un aspecto económico: el artículo estima el coste de operar AAR en unos 4 dólares por hora de inferencia de la interfaz de programación de aplicaciones, frente a los 150 dólares por hora que se pagaba a los investigadores humanos en el experimento. Estas cifras no demuestran que los sistemas automatizados puedan sustituir a los investigadores, pero sí explican por qué los laboratorios están interesados en ampliar el alcance de los experimentos automatizados cuando la tarea es medible.

¿Por qué esto no significa que la inteligencia artificial se desarrolle a sí misma sin restricciones?

El paso presentado se acerca a la idea de la mejora iterativa autónoma, es decir, que los modelos utilicen otros sistemas para mejorar sus métodos de entrenamiento o su comportamiento, pero el propio artículo establece límites claros para esta conclusión. El sistema no puede mejorar aquello que los criterios no miden adecuadamente. Si las pruebas de alineación no reflejan los objetivos reales de alineación, mejorar los resultados puede conducir a mejorar únicamente el rendimiento en el indicador, no a resolver el problema que se supone que este debe medir.

Este enfoque también requiere un esfuerzo continuo para crear, mantener y ampliar los criterios, además de actualizar la bibliografía en la que se basa el investigador automatizado. Por ello, el elemento humano sigue presente a la hora de determinar qué debe medirse, evaluar la validez de las pruebas y los métodos utilizados, y revisar si los resultados pueden generalizarse fuera del conjunto de pruebas.

La lectura de certi.news

El resultado importante aquí es que la automatización de la investigación sobre alineación pasó de ser una idea general a convertirse en un experimento concreto con cifras y comparaciones debatibles: diez pruebas, rondas de entrenamiento de 30 minutos y una superioridad media frente a propuestas humanas durante seis horas, según lo expuesto en el artículo. Sin embargo, la importancia práctica sigue estando vinculada a la calidad de los criterios que orientan el sistema. La mejora medida no es una prueba independiente de que el modelo se haya vuelto más seguro en todos los contextos, y la comparación entre el coste de la inferencia y el de los investigadores tampoco resuelve la cuestión de la supervisión o la responsabilidad científica.

Por tanto, el artículo ofrece un indicio sólido de la posibilidad de acelerar el ciclo de investigación sobre alineación, no una prueba de que los laboratorios estén cerca de prescindir de los investigadores humanos. La pregunta abierta que deja es si los sistemas automatizados podrán abordar objetivos de alineación más realistas y complejos, en lugar de mejorar indicadores específicos diseñados previamente por humanos.

Fuente de la noticia
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias