OpenAI publicó en GitHub una colección de 722 estudios matemáticos producidos por un modelo de inteligencia artificial interno que la empresa todavía no ha puesto a disposición del público. La colección abarca 372 familias de resultados, incluidos intentos de abordar problemas abiertos cuya resolución se ha prolongado durante mucho tiempo, según la evaluación del grupo independiente Advisory Group on Mathematics and Artificial Intelligence (AGMAI).
Sin embargo, la publicación de estos trabajos no significa que se los considere logros matemáticos definitivos. OpenAI explica que los resultados se encuentran en distintas etapas de verificación y que algunos estudios informales pueden contener errores, mientras que todos necesitan la revisión de la comunidad matemática y su confirmación mediante los canales académicos habituales.
De unas 4.000 preguntas a 722 estudios
Durante el proceso de evaluación, el modelo fue probado con unas 4.000 preguntas matemáticas. Después de filtrar los resultados según su nivel de importancia, OpenAI seleccionó la colección publicada, compuesta por 372 familias y 722 estudios. La empresa afirma que producir un resultado requirió, en promedio, una capacidad computacional equivalente a unas tres horas de la capacidad de razonamiento disponible para los usuarios de ChatGPT Pro.
Para reforzar la posibilidad de examen, OpenAI publicó datos adicionales sobre 10 problemas, incluidos resúmenes breves del proceso de razonamiento, estimaciones de la capacidad computacional utilizada y el número de problemas que se intentaron. Los ejemplos abarcan distintos campos, entre ellos una medida de la irracionalidad del número π, las conjeturas de Mahler, la conjetura de Kaplansky sobre la finitud directa y el sistema de Vlasov-Maxwell relativista tridimensional.
La verificación mediante Lean no es exhaustiva
Una parte importante de las demostraciones publicadas fue revisada mediante Lean, un sistema de verificación matemática que permite al ordenador comprobar la coherencia lógica de la demostración. No obstante, hasta ahora no todos los estudios de la colección cuentan con una verificación formal mediante Lean.
OpenAI tiene previsto actualizar el repositorio de GitHub a medida que se completen los procesos de verificación formal. La empresa afirma que la mayoría de los resultados se produjeron siguiendo un procedimiento unificado, con algunas excepciones; uno de los estudios relacionados con una región libre de ceros de la función zeta de Riemann se obtuvo de otra manera y su texto fue editado por una persona para mejorar su legibilidad.
¿Por qué es importante esta noticia?
El valor principal de la colección no reside únicamente en el número de estudios, sino también en poner a prueba un nuevo método para producir resultados matemáticos que puedan ser revisados. La disponibilidad de los archivos, los datos sobre el coste computacional, los resúmenes del razonamiento y la verificación automática parcial proporciona elementos que los investigadores necesitan para evaluar si el modelo produce descubrimientos que puedan volver a examinarse o simplemente textos que parecen convincentes.
Al mismo tiempo, siguen existiendo limitaciones claras: la verificación no está completa, la revisión humana y académica aún no ha terminado y los resultados del modelo todavía no representan un sistema disponible para los investigadores ni un producto público. AGMAI insta a las empresas de inteligencia artificial a publicar los resultados matemáticos a través de los canales académicos, revelar los modelos, el coste y los métodos utilizados, y no convertir los descubrimientos en una mera herramienta de marketing.
OpenAI también anunció que financiará talleres, conferencias y programas especiales para comprender los resultados importantes producidos por la inteligencia artificial, paralelamente a su trabajo para poner el modelo interno a disposición de forma responsable. Por ello, la colección actual representa un paso experimental en la manera de documentar los resultados científicos generados automáticamente, no un juicio definitivo sobre la capacidad matemática del modelo.