Die Anzahl der Designvariablen allein bestimmt nicht den Datenumfang, der zum Training eines maschinellen Lernmodells erforderlich ist, das Ergebnisse computergestützter Ingenieursimulationen (CAE) vorhersagt. Laut einem von Semiconductor Engineering am 3. September 2026 veröffentlichten Beitrag ist der wichtigste Faktor die Art der Antwort, die das Modell erlernen soll: Kontinuierliche und glatte Antworten sind leichter vorherzusagen als Ergebnisse, die sich beim Überschreiten eines Schwellenwerts ändern oder schnell oszillierende Signale enthalten.
Der Beitrag stützt sich auf vier Studien zu Fahrzeugcrashs. In dieser Art von Arbeitsablauf stellt jedes Designexperiment die Ausführung einer vollständigen, expliziten Crashsimulation dar, wodurch der Aufbau des Trainingsdatensatzes zum kostspieligsten Teil wird, bevor ein Modell in der Lage ist, neue Designs innerhalb von Sekunden statt Stunden zu bewerten.
Die Anzahl der Variablen ist kein ausreichendes Maß
Der Vergleich zweier Studien zeigt, dass der Umfang des Datensatzes nicht direkt proportional zur Anzahl der Designvariablen ist. Eine Studie zur Seitenschwellerstruktur eines Elektrofahrzeugs benötigte viermal so viele Experimente wie eine aus 25 Experimenten bestehende Studie zur Insassensicherheit, obwohl die erste Studie eine einfachere Darstellung verwendete, die die Dicken zweier Bleche und die Position eines davon umfasste, während die Insassenstudie mehrere Variablen im Rückhaltesystem veränderte, etwa die Reibung der Puppe am Sicherheitsgurt, den Zeitpunkt des Gurtsensors und die Position der Umlenkschlaufe.
Der Beitrag stellte außerdem keinen direkten Zusammenhang zwischen der Modellgröße oder der Intensität des Lastfalls und der erforderlichen Anzahl von Experimenten fest. Der entscheidende Faktor zeigte sich beim Training von Prädiktoren aus derselben Gruppe von 100 Experimenten unter Verwendung derselben drei Designvariablen. Bei der Vorhersage der Masse der Schwellerstruktur erreichte die Vorhersage eine Güte von 0,98, während sie bei der Vorhersage der Anzahl beschädigter Batteriezellen 0,64 betrug.
Die Art der Antwort bestimmt die Lernschwierigkeit
Die Erklärung für diesen Unterschied liegt in der Physik. Die Masse ist eine glatte, nahezu monotone Antwort, die von der Blechdicke beeinflusst wird, während die Anzahl beschädigter Zellen eine ganzzahlige Größe darstellt, die durch das Überschreiten einer bestimmten Spannungsschwelle entsteht und zu einem internen Kurzschluss führt. Eine kleine geometrische Änderung kann eine Zelle vom unbeschädigten in den beschädigten Zustand überführen oder auch nicht, wodurch das Modell zahlreiche getrennte Grenzbereiche erlernen muss.
Dasselbe Muster zeigte sich in einer aus 60 Experimenten bestehenden Studie zu einem Frontalcrash. Die Vorhersagefehler für Eindringpositionen lagen im Vergleich zur Finite-Elemente-Analyse (FE) zwischen 0,9 % und 12,6 %, während die Fehler bei der Vorhersage der Beschleunigungen an den Sitzbefestigungspunkten 16,8 % erreichten. Der Beitrag führt dies darauf zurück, dass die Eindringung eine glattere Verschiebung ist, während die Beschleunigung die zweite Ableitung der Verschiebung darstellt und hochfrequente Komponenten enthält.
Reichhaltige Ausgaben bedeuten nicht immer mehr Daten
Die Frontcrash-Studie liefert ein weiteres, möglicherweise kontraintuitives Ergebnis. Die Prädiktoren für die grundlegenden Werte benötigten alle 60 Experimente, die Prädiktoren für zweidimensionale Kurven und dreidimensionale Felder wurden jedoch nur mit 20 Experimenten trainiert. Diese Felder umfassen die Verschiebung und die plastische Dehnung an drei Integrationspunkten über die Dicke und in jedem Zeitschritt.
Die im Beitrag genannte mögliche Erklärung lautet, dass ein einzelnes Experiment einem Feldprädiktor wesentlich mehr Trainingsdaten liefert als einem Prädiktor, der mit einem einzelnen numerischen Wert arbeitet. Das Experiment liefert eine einzige Zahl für die maximale Eindringung an der Fußposition, gleichzeitig aber ein räumlich zusammenhängendes Feld über das Modell hinweg und zu sämtlichen Zeitpunkten.
Was ändert sich praktisch bei der Versuchsplanung?
Die vorgeschlagene praktische Regel lautet, die Simulationskampagne nach der am wenigsten glatten Antwort und nicht nach der komplexesten Form der Ausgaben auszurichten. Bevor das gesamte Lösungsbudget gebunden wird, empfiehlt der Beitrag, eine Pilotphase zu beginnen und die vorläufigen Daten zu analysieren.
- Korrelationsmatrizen und Streudiagramme untersuchen, um festzustellen, welche Variablen die jeweilige Antwort beeinflussen.
- Die Vorhersagegüte verwenden, die lineare und nichtlineare Beziehungen auf einer Skala von 0 bis 1 erfasst, um die Schwierigkeit der Antwort vor dem Training eines vollständigen Prädiktors abzuschätzen.
- Die Lernkurve lesen, die den Datenumfang mit der Genauigkeit verknüpft, um festzustellen, ob weitere 20 Experimente einen Nutzen bringen oder ob die Leistung bereits ein Plateau erreicht hat.
- Jede Vorhersage mit ihren Fehlergrenzen verknüpfen; liegt eine Vorhersage außerhalb der angegebenen Grenzen oder ihres Konfidenzbereichs, sollte sie als Hinweis auf die Durchführung einer neuen Simulation und nicht als verlässliche Antwort behandelt werden.
- Karten zur Bedeutung der Designvariablen verwenden, um die Ausgaben für Variablen mit geringem Einfluss zu reduzieren und die Experimente auf einflussreiche Variablen umzulenken.
Der Beitrag macht deutlich, dass der Unterschied zwischen einer Kampagne mit 25 Experimenten und einer mit 100 Experimenten eine Vervierfachung der expliziten Rechenzeit und der Kalendertage bedeuten kann. Eine übermäßige Reduzierung der Daten führt dagegen zum Scheitern der Validierung und zum Vertrauensverlust in die Methode, während eine Überdimensionierung die Kosten für Experimente erhöht, deren Nichtnotwendigkeit die Lernkurve gezeigt hätte.
In einem Anwendungsbeispiel wurden die Prädiktoren als Antwortflächenmodelle eingesetzt, um über 500 Iterationen hinweg innerhalb weniger Minuten eine Optimierung mit einem Simulated-Annealing-Algorithmus zu steuern. Die Vorhersage der Verletzungskennwerte dauerte dabei Sekunden statt einer vollständigen Simulation für jede Iteration.
Lesen von certi.news
Der wesentliche Wert liegt hier nicht im Versprechen, dass maschinelle Lernmodelle Simulationen abschaffen werden, sondern darin, dass sie ein besseres Kriterium für die Verteilung des Versuchsbudgets liefern: Die Schwierigkeit des physikalischen Ziels ist wichtiger als die Anzahl der Eingaben oder der Reichtum der Ausgabe. Die dargestellten Ergebnisse stammen jedoch aus einem gesponserten Blogbeitrag und präsentieren spezifische Studien, ohne im verfügbaren Text die vollständigen methodischen Einzelheiten offenzulegen. Daher sollten die Regeln zur Auswahl des Datenumfangs als Ausgangspunkt für Experimente und Validierung betrachtet werden, nicht als Ersatz für eine unabhängige technische Validierung oder für die Lösung von Fällen, die außerhalb der Konfidenzgrenzen liegen.