Un equipo de la Universidad de Manchester, en colaboración con el equipo de NVIDIA Earth-2, desarrolló un modelo basado en inteligencia artificial para simular y predecir la contaminación del aire en todo el Reino Unido, con una resolución espacial de entre dos y tres kilómetros. El proyecto busca reducir el elevado coste computacional de los modelos tradicionales que combinan datos meteorológicos e interacciones químicas en la atmósfera.
El trabajo está dirigido por David Topping, profesor del Departamento de Ciencias de la Tierra y del Medio Ambiente de la Universidad de Manchester. El equipo utilizó datos de contaminación generados mediante una simulación químico-climática que cubría un año completo, con intervalos horarios, y después entrenó un modelo Earth-2 CorrDiff para generar mapas más detallados de la distribución de los contaminantes. Según NVIDIA, el modelo completó con éxito su primer intento de entrenamiento.
De la simulación química a la predicción rápida
Los modelos tradicionales de calidad del aire requieren cálculos intensivos debido a la incorporación de la química atmosférica en los modelos meteorológicos, lo que limita el nivel de detalle y el número de ejecuciones. El equipo de Manchester intentó utilizar los marcos de inteligencia artificial generativa desarrollados por NVIDIA para el tiempo y el clima con el objetivo de trabajar con «campos» de contaminación en lugar de calcular todas las interacciones mediante el método tradicional.
El entrenamiento utilizó un único nodo equipado con ocho unidades de procesamiento gráfico en el superordenador británico Isambard-AI, en Bristol. El sistema cuenta con 5.448 chips NVIDIA GH200 Grace Hopper Superchip, con una capacidad anunciada de 21 exaflops para cargas de trabajo de inteligencia artificial. El entrenamiento duró dos días, según el material publicado.
Posteriormente, el equipo añadió el modelo Earth-2 StormCast para producir predicciones dependientes del tiempo que utilizan directamente observaciones de la calidad del aire. Los investigadores también mostraron los procesos de entrenamiento e inferencia en el sistema de escritorio NVIDIA DGX Spark, impulsado por un chip GB10 Grace Blackwell. Topping afirma que tener un dispositivo DGX Spark en su despacho le permite volver a entrenar los modelos y realizar entrenamientos más pequeños sin recurrir al superordenador.
¿Por qué es importante este avance?
El material afirma que la contaminación del aire contribuyó a unas 30.000 muertes en el Reino Unido durante el año pasado, lo que hace que la mejora de las predicciones tenga una relación directa con la salud pública. Los servicios sanitarios podrían utilizar estas predicciones para informar a pacientes con afecciones como el asma de un aumento previsto de la contaminación en su zona al día siguiente o durante la semana siguiente.
El equipo también está probando la conexión del modelo con dispositivos de inteligencia artificial periférica que reciben mediciones de la calidad del aire en tiempo real. Entre las aplicaciones propuestas está el apoyo a decisiones rápidas durante incendios forestales, además del uso del modelo para simular el efecto de posibles cambios en las políticas gubernamentales relacionadas con la contaminación.
¿Qué cambia en la práctica?
El cambio más destacado es el paso de ejecuciones centralizadas y costosas a un modelo que puede ejecutarse, al menos para inferencias y algunos entrenamientos, en un dispositivo de escritorio. El equipo planea aumentar la resolución del modelo hasta el nivel de las calles mediante la integración de datos públicos adicionales y también pretende publicar los datos de entrenamiento y los flujos de trabajo como código abierto, para que otros países y ciudades puedan construir modelos locales con sus propios datos.
Sin embargo, el material no ofrece resultados cuantitativos detallados sobre la precisión de las predicciones en comparación con los modelos químicos tradicionales, ni demuestra todavía la puesta en marcha de un servicio sanitario o un sistema público de alerta basado en el modelo. Por tanto, las promesas relacionadas con las predicciones en tiempo real y las aplicaciones clínicas siguen siendo objetivos en fase de exploración, no servicios ya disponibles. La importancia del proyecto reside actualmente en demostrar la posibilidad de trasladar los marcos de Earth-2 al ámbito de la contaminación del aire y reducir el umbral de acceso a las herramientas de modelización, mientras que la validación independiente, la calidad de los datos locales y el calendario de publicación de los recursos abiertos siguen siendo cuestiones que requieren respuesta.