Inteligencia artificial

¿Cómo determinan los ingenieros de simulación cuántos experimentos se necesitan para entrenar un modelo de aprendizaje automático?

Un artículo técnico de Semiconductor Engineering, basado en cuatro estudios de impacto, muestra que el volumen de datos de entrenamiento y la precisión del modelo están más relacionados con la suavidad de la respuesta física que con el número de variables de diseño o el tamaño del modelo. Propone utilizar curvas de aprendizaje, límites de error e importancia de las variables para reducir los costosos experimentos de simulación.

2026-09-03
7 min de lectura
6 visitas
فريق تحرير certi.news
¿Cómo determinan los ingenieros de simulación cuántos experimentos se necesitan para entrenar un modelo de aprendizaje automático?

El número de variables de diseño por sí solo no determina el volumen de datos necesario para entrenar un modelo de aprendizaje automático que prediga resultados de simulaciones de ingeniería asistida por computadora (CAE). Según un artículo publicado por Semiconductor Engineering el 3 de septiembre de 2026, el factor más importante es la naturaleza de la respuesta que el modelo intenta aprender: las respuestas continuas y suaves son más fáciles de predecir que los resultados que cambian al cruzar un umbral o que contienen señales que oscilan rápidamente.

El artículo se basa en cuatro estudios sobre impactos de vehículos. En este tipo de flujo de trabajo, cada experimento de diseño representa la ejecución de una simulación completa y explícita de un impacto, lo que hace que la construcción del conjunto de entrenamiento sea la parte más costosa antes de disponer de un modelo capaz de evaluar nuevos diseños en segundos en lugar de horas.

El número de variables no es una métrica suficiente

La comparación entre dos estudios muestra que el tamaño del conjunto de datos no es directamente proporcional al número de variables de diseño. Un estudio sobre la estructura del umbral lateral de un vehículo eléctrico necesitó cuatro veces el número de experimentos requeridos por un estudio de seguridad de los ocupantes compuesto por 25 experimentos, aunque el primer estudio utilizó una representación más sencilla que incluía los espesores de dos paneles y la posición de uno de ellos, mientras que el estudio de los ocupantes modificó varias variables del sistema de retención, como la fricción entre el maniquí y el cinturón de seguridad, el momento de activación del sensor del cinturón y la posición del anillo deslizante.

El artículo tampoco encontró una relación directa entre el tamaño del modelo o la intensidad de la carga y el número de experimentos necesarios. El factor decisivo apareció al entrenar predictores a partir de un mismo conjunto compuesto por 100 experimentos y utilizando las mismas tres variables de diseño. La predicción de la masa de la estructura del umbral alcanzó una puntuación de capacidad predictiva de 0.98, mientras que la predicción del número de celdas de batería dañadas alcanzó una puntuación de 0.64.

La naturaleza de la respuesta determina la dificultad del aprendizaje

La explicación de esta diferencia está relacionada con la física. La masa es una respuesta suave y casi monótona que se ve afectada por el espesor del panel, mientras que el número de celdas dañadas es un valor entero resultante de superar un umbral de tensión específico que provoca un cortocircuito interno. Un pequeño cambio geométrico puede trasladar una celda de un estado sin daño a un estado dañado, o no hacerlo, lo que obliga al modelo a aprender muchas fronteras separadas.

El patrón se repitió en un estudio de impacto frontal compuesto por 60 experimentos. Los errores de predicción de las posiciones de intrusión, en comparación con el análisis de elementos finitos (FE), estuvieron entre el 0.9% y el 12.6%, mientras que los errores en la predicción de las aceleraciones en los puntos de fijación del asiento alcanzaron el 16.8%. El artículo relaciona esto con el hecho de que la intrusión es un desplazamiento más suave, mientras que la aceleración es la segunda derivada del desplazamiento y contiene componentes de alta frecuencia.

Las salidas ricas no siempre significan más datos

El estudio frontal ofrece otro resultado que puede parecer contraintuitivo. Los predictores de los valores básicos necesitaron los 60 experimentos, pero los predictores de las curvas bidimensionales y de los resultados de los campos tridimensionales se entrenaron con solo 20 experimentos. Estos campos incluyen el desplazamiento y la deformación plástica en tres puntos de integración a través del espesor y en cada paso temporal.

La explicación posible que menciona el artículo es que un solo experimento proporciona al predictor de campo una cantidad de datos de entrenamiento mucho mayor que la que recibe un predictor que trabaja con un único valor numérico. El experimento ofrece un solo número para la intrusión máxima en la posición del pie, pero al mismo tiempo proporciona un campo espacial correlacionado a través del modelo y en todos los instantes temporales.

¿Qué cambia en la práctica al planificar los experimentos?

La regla práctica propuesta es diseñar la campaña de simulación según la respuesta menos suave, no según la forma más compleja de las salidas. Antes de comprometer todo el presupuesto de cálculo, el artículo recomienda iniciar una fase piloto y analizar los datos iniciales.

  • Examinar la matriz de correlación y los diagramas de dispersión para determinar qué variables impulsan cada respuesta.
  • Utilizar la puntuación de capacidad predictiva, que detecta relaciones lineales y no lineales en una escala de 0 a 1, para estimar la dificultad de la respuesta antes de entrenar un predictor completo.
  • Leer la curva de aprendizaje que relaciona el volumen de datos con la precisión, para determinar si añadir otros 20 experimentos será útil o si el rendimiento ya ha alcanzado una fase de estabilización.
  • Vincular cada predicción con sus límites de error; si la predicción queda fuera de los límites comunicados o de su intervalo de confianza, debe tratarse como una señal para ejecutar una nueva simulación, no como una respuesta fiable.
  • Utilizar mapas de importancia de las variables de diseño para reducir el gasto en variables de poca influencia y reorientar los experimentos hacia las variables relevantes.

El artículo explica que la diferencia entre una campaña de 25 experimentos y otra de 100 experimentos puede significar cuadruplicar el tiempo de cálculo explícito y el número de días naturales. En cambio, reducir demasiado los datos provoca fallos en la validación y pérdida de confianza en el método, mientras que sobredimensionarlos implica pagar por experimentos cuya falta de necesidad habría revelado la curva de aprendizaje.

En un ejemplo práctico, los predictores se utilizaron como modelos de superficie de respuesta para dirigir una optimización mediante un algoritmo de recocido simulado a lo largo de 500 iteraciones en unos minutos, ya que la predicción de los criterios de lesión tardó segundos en lugar de requerir una simulación completa en cada iteración.

La lectura de certi.news

El valor fundamental aquí no es la promesa de que los modelos de aprendizaje automático eliminarán las simulaciones, sino que ofrecen un criterio mejor para distribuir el presupuesto de experimentación: la dificultad del objetivo físico es más importante que el número de entradas o la riqueza de la salida. Sin embargo, los resultados presentados proceden de un artículo patrocinado y exponen estudios específicos sin incluir todos los detalles metodológicos en el texto disponible; por ello, las reglas para elegir el volumen de datos deben considerarse un punto de partida para la experimentación y la validación, no un sustituto de la validación de ingeniería independiente ni de la resolución de los casos que quedan fuera de los límites de confianza.

Fuente de la noticia
Semiconductor Engineering
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias