Inteligência artificial

Como os engenheiros de simulação determinam o número de experimentos necessários para treinar um modelo de aprendizado de máquina?

Um artigo técnico da Semiconductor Engineering, baseado em quatro estudos de colisões, explica que o volume de dados de treinamento e a precisão do modelo estão mais relacionados à suavidade da resposta física do que ao número de variáveis de projeto ou ao tamanho do modelo. O artigo propõe o uso de curvas de aprendizado, limites de erro e importância das variáveis para reduzir experimentos de simulação dispendiosos.

2026-09-03
7 min de leitura
6 visualizações
فريق تحرير certi.news
Como os engenheiros de simulação determinam o número de experimentos necessários para treinar um modelo de aprendizado de máquina?

O número de variáveis de projeto, por si só, não determina o volume de dados necessário para treinar um modelo de aprendizado de máquina que preveja resultados de simulações de engenharia assistida por computador (CAE). De acordo com um artigo publicado pela Semiconductor Engineering em 3 de setembro de 2026, o fator mais importante é a natureza da resposta que o modelo tenta aprender: respostas contínuas e suaves são mais fáceis de prever do que resultados que mudam ao atravessar um limiar ou que incluem sinais de rápida oscilação.

O artigo baseia-se em quatro estudos de colisões de veículos. Nesse tipo de fluxo de trabalho, cada experimento de projeto representa a execução de uma simulação completa e explícita de colisão, o que torna a construção do conjunto de treinamento a parte mais dispendiosa antes de se chegar a um modelo capaz de avaliar novos projetos em segundos, em vez de horas.

O número de variáveis não é uma métrica suficiente

A comparação entre dois estudos mostra que o tamanho do conjunto de dados não é diretamente proporcional ao número de variáveis de projeto. Um estudo da estrutura da soleira lateral de um veículo elétrico precisou de quatro vezes o número de experimentos exigidos por um estudo de segurança dos ocupantes composto por 25 experimentos, embora o primeiro estudo tenha usado uma representação mais simples, que incluía as espessuras de duas chapas e a posição de uma delas, enquanto o estudo dos ocupantes alterou várias variáveis do sistema de retenção, como o atrito do manequim com o cinto de segurança, o tempo do sensor do cinto e a posição do anel deslizante.

O artigo também não encontrou uma relação direta entre o tamanho do modelo ou a intensidade da condição de carregamento e o número de experimentos necessários. O fator decisivo surgiu ao treinar preditores a partir de um único conjunto composto por 100 experimentos e usando as mesmas três variáveis de projeto. A previsão da massa da estrutura da soleira alcançou um grau de capacidade preditiva de 0,98, enquanto a previsão do número de células de bateria danificadas alcançou 0,64.

A natureza da resposta determina a dificuldade do aprendizado

A explicação para essa diferença está relacionada à física. A massa é uma resposta suave e quase monotônica, influenciada pela espessura da chapa, enquanto o número de células danificadas é um valor inteiro resultante da ultrapassagem de um limiar de tensão específico que provoca um curto-circuito interno. Uma pequena alteração geométrica pode transferir uma célula do estado não danificado para o estado danificado, ou não fazê-lo, obrigando o modelo a aprender as localizações de muitos limites distintos.

O padrão se repetiu em um estudo de colisão frontal composto por 60 experimentos. Os erros de previsão das posições de intrusão, em comparação com a análise de elementos finitos (FE), ficaram entre 0,9% e 12,6%, enquanto os erros na previsão das acelerações nos pontos de fixação do banco chegaram a 16,8%. O artigo relaciona isso ao fato de que a intrusão é um deslocamento mais suave, enquanto a aceleração é a segunda derivada do deslocamento e contém componentes de alta frequência.

Saídas ricas nem sempre significam mais dados

O estudo frontal apresenta outro resultado que pode parecer contraintuitivo. Os preditores dos valores básicos precisaram de todos os 60 experimentos, mas os preditores das curvas bidimensionais e dos resultados dos campos tridimensionais foram treinados com apenas 20 experimentos. Esses campos incluem o deslocamento e a deformação plástica em três pontos de integração ao longo da espessura e em cada passo de tempo.

A explicação possível mencionada pelo artigo é que um único experimento fornece ao preditor de campo uma quantidade de dados de treinamento muito maior em comparação com um preditor que lida com um único valor numérico. O experimento fornece um único número para a intrusão máxima na região do apoio dos pés, mas, ao mesmo tempo, fornece um campo espacial correlacionado por todo o modelo e em todos os instantes de tempo.

O que muda na prática no planejamento dos experimentos?

A regra prática proposta é elaborar a campanha de simulação de acordo com a resposta menos suave, e não com base na forma mais complexa das saídas. Antes de comprometer todo o orçamento de resolução, o artigo recomenda iniciar uma fase experimental e analisar os dados preliminares.

  • Examinar a matriz de correlação e os gráficos de dispersão para descobrir quais variáveis impulsionam cada resposta.
  • Usar o grau de capacidade preditiva, que detecta relações lineares e não lineares em uma escala de 0 a 1, para estimar a dificuldade da resposta antes de treinar um preditor completo.
  • Ler a curva de aprendizado que relaciona o volume de dados à precisão, para saber se a adição de mais 20 experimentos será útil ou se o desempenho já atingiu uma fase de estabilização.
  • Associar cada previsão aos seus limites de erro; se a previsão sair dos limites informados ou do seu intervalo de confiança, ela deve ser tratada como um sinal para realizar uma nova simulação, e não como uma resposta confiável.
  • Usar mapas de importância das variáveis de projeto para reduzir os gastos com variáveis de pouca influência e redirecionar os experimentos para as variáveis relevantes.

O artigo explica que a diferença entre uma campanha de 25 experimentos e outra de 100 experimentos pode significar quatro vezes mais tempo de resolução explícita e mais dias corridos. Por outro lado, reduzir demais os dados leva à falha da validação e à perda de confiança no método, enquanto ampliá-los excessivamente gera o custo de experimentos cuja desnecessidade a curva de aprendizado teria revelado.

Em um exemplo prático, os preditores foram usados como modelos de superfície de resposta para conduzir uma otimização com o algoritmo de recozimento simulado ao longo de 500 iterações em poucos minutos, pois a previsão dos critérios de lesão levou segundos, em vez da execução de uma simulação completa a cada iteração.

Leitura da certi.news

O principal valor aqui não é a promessa de que os modelos de aprendizado de máquina eliminarão as simulações, mas sim o fato de que eles oferecem um critério melhor para distribuir o orçamento de experimentos: a dificuldade do objetivo físico é mais importante do que o número de entradas ou a riqueza da saída. No entanto, os resultados apresentados vêm de um artigo patrocinado e expõem estudos específicos sem os detalhes metodológicos completos no texto disponível; portanto, as regras para escolher o volume de dados devem ser consideradas um ponto de partida para experimentação e validação, e não um substituto para a validação de engenharia independente nem para a resolução de casos que estejam fora dos limites de confiança.

Fonte da notícia
Semiconductor Engineering
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias