설계 변수의 수만으로 컴퓨터 지원 공학(CAE) 시뮬레이션 결과를 예측하는 머신러닝 모델을 훈련하는 데 필요한 데이터 규모를 결정할 수는 없다. Semiconductor Engineering이 2026년 9월 3일에 게재한 자료에 따르면, 더 중요한 요소는 모델이 학습하려는 응답의 특성이다. 즉, 연속적이고 매끄러운 응답은 임계값을 넘을 때 변하거나 빠르게 진동하는 신호를 포함하는 결과보다 예측하기 쉽다.
이 자료는 차량 충돌에 관한 네 가지 연구를 바탕으로 한다. 이러한 작업 흐름에서 각 설계 실험은 완전한 명시적 충돌 시뮬레이션을 실행하는 것을 의미하므로, 새로운 설계를 몇 시간이 아니라 몇 초 만에 평가할 수 있는 모델에 도달하기 전까지 훈련 세트를 구축하는 과정이 가장 큰 비용이 든다.
변수의 수만으로는 충분한 척도가 아니다
두 연구를 비교하면 데이터 세트의 규모가 설계 변수의 수에 직접 비례하지 않는다는 점이 나타난다. 전기차의 측면 문턱 구조 연구에는 25회의 실험으로 구성된 탑승자 안전 연구보다 네 배 많은 실험이 필요했다. 첫 번째 연구는 두 판의 두께와 그중 하나의 위치를 포함하는 더 단순한 표현을 사용했지만, 탑승자 연구에서는 안전 구속 시스템의 여러 변수를 변경했기 때문이다. 여기에는 안전벨트와 더미의 마찰, 벨트 센서의 작동 시간, 슬립 링의 위치 등이 포함됐다.
또한 이 자료는 모델의 규모나 하중 조건의 강도와 필요한 실험 횟수 사이에 직접적인 관계를 찾지 못했다. 결정적인 요인은 동일한 100회 실험으로 구성된 하나의 세트에서 동일한 세 가지 설계 변수를 사용해 예측기를 훈련했을 때 나타났다. 문턱 구조의 질량을 예측하는 경우 예측 능력 점수는 0.98이었지만, 손상된 배터리 셀의 수를 예측하는 경우에는 0.64였다.
응답의 특성이 학습 난이도를 결정한다
이 차이는 물리학과 관련이 있다. 질량은 판의 두께에 영향을 받는 매끄럽고 거의 단조로운 응답인 반면, 손상된 셀의 수는 특정 응력 임계값을 넘어 내부 단락이 발생한 결과로 나타나는 정수값이다. 작은 형상 변화로 인해 셀이 무손상 상태에서 손상 상태로 바뀔 수도 있고 그렇지 않을 수도 있으므로, 모델은 서로 분리된 많은 경계의 위치를 학습해야 한다.
60회의 실험으로 구성된 정면 충돌 연구에서도 같은 양상이 반복됐다. 유한요소(FE) 분석과 비교했을 때 침투 위치 예측 오차는 0.9%에서 12.6% 사이였지만, 시트 고정 지점의 가속도 예측 오차는 16.8%에 달했다. 이 자료는 침투가 더 매끄러운 변위인 반면 가속도는 변위의 2차 미분이며 고주파 성분을 포함하기 때문이라고 설명한다.
풍부한 출력이 항상 더 많은 데이터를 의미하지는 않는다
정면 충돌 연구는 직관에 어긋날 수 있는 또 다른 결과를 제시한다. 기본값에 관한 예측기는 60회의 실험 전체를 필요로 했지만, 2차원 곡선과 3차원 필드 결과에 관한 예측기는 단 20회의 실험으로 훈련됐다. 이러한 필드에는 모델을 통과하는 세 개의 두께 방향 적분점과 각 시간 단계에서의 변위 및 소성 변형률이 포함된다.
이 자료가 제시하는 가능한 설명은 하나의 실험이 단일 수치만 다루는 예측기에 비해 필드 예측기에 훨씬 더 많은 훈련 데이터를 제공한다는 것이다. 실험은 발 위치에서의 최대 침투에 대해서는 하나의 수치만 제공하지만, 동시에 모델 전체와 모든 시간 단계에 걸쳐 서로 연관된 공간 필드를 제공한다.
실제로 실험 계획에서 무엇이 달라지는가?
제안된 실무 규칙은 가장 복잡한 출력 형태가 아니라 가장 매끄럽지 않은 응답을 기준으로 시뮬레이션 캠페인을 설계하는 것이다. 모든 솔버 예산을 확정하기 전에, 이 자료는 파일럿 단계를 시작하고 초기 데이터를 분석할 것을 권고한다.
- 상관 행렬과 산점도를 검토해 각 응답을 움직이는 변수를 파악한다.
- 0에서 1 사이의 척도로 선형 및 비선형 관계를 포착하는 예측 능력 점수를 사용해 완전한 예측기를 훈련하기 전에 응답의 난이도를 추정한다.
- 데이터 규모와 정확도를 연결하는 학습 곡선을 읽어 실험을 20회 더 추가하는 것이 도움이 될지, 아니면 성능이 이미 안정화 단계에 도달했는지 파악한다.
- 각 예측을 오차 한계와 연결한다. 예측이 보고된 한계나 자체 신뢰 구간을 벗어나면 신뢰할 수 있는 답변이 아니라 새로운 솔버 실행을 수행해야 한다는 신호로 취급해야 한다.
- 설계 변수 중요도 지도를 사용해 영향이 약한 변수에 대한 지출을 줄이고 실험을 영향력 있는 변수로 재배분한다.
이 자료는 25회 실험 캠페인과 100회 실험 캠페인의 차이가 명시적 솔버 실행 시간과 달력상 소요 일수에서 네 배의 차이를 의미할 수 있다고 설명한다. 반대로 데이터를 지나치게 줄이면 검증에 실패하고 방법론에 대한 신뢰를 잃게 되며, 데이터를 과도하게 늘리면 학습 곡선이 불필요하다고 밝혔을 실험 비용까지 부담하게 된다.
한 적용 사례에서는 예측기를 응답 표면 모델로 사용해 500회 반복 동안 시뮬레이티드 어닐링 알고리즘을 통한 최적화를 몇 분 안에 수행했다. 손상 기준을 예측하는 데 반복마다 완전한 시뮬레이션을 실행하는 대신 몇 초가 걸렸기 때문이다.
certi.news의 해석
여기서 핵심적인 가치는 머신러닝 모델이 시뮬레이션을 없앨 것이라는 약속이 아니라, 실험 예산을 배분하기 위한 더 나은 기준을 제공한다는 데 있다. 즉, 물리적 목표의 난이도가 입력의 수나 출력의 풍부함보다 중요하다. 그러나 제시된 결과는 후원으로 작성된 블로그 자료에서 나온 것이며, 이용 가능한 본문에는 완전한 방법론의 세부 사항 없이 특정 연구만 제시되어 있다. 따라서 데이터 규모를 선택하는 규칙은 실험과 검증을 위한 출발점으로 보아야 하며, 독립적인 공학적 검증이나 신뢰 구간을 벗어나는 사례의 해석을 대신하는 것으로 보아서는 안 된다.