仅凭设计变量的数量,无法确定训练一个用于预测计算机辅助工程(CAE)仿真结果的机器学习模型所需的数据规模。根据Semiconductor Engineering于2026年9月3日发布的文章,最重要的因素是模型试图学习的响应性质:连续且平滑的响应比跨越阈值时发生变化或包含快速振荡信号的结果更容易预测。
文章基于四项车辆碰撞研究。在这类工作流程中,每次设计实验都代表一次完整的显式碰撞仿真,因此在获得能够在数秒内而非数小时内评估新设计的模型之前,构建训练集是成本最高的环节。
变量数量并不是充分的衡量标准
两项研究的比较显示,数据集规模并不与设计变量数量直接成正比。一项电动汽车侧槛结构研究所需的实验数量,是一项由25次实验组成的乘员安全研究所需数量的四倍,尽管前者采用了更简单的表示方式,包括两块板的厚度及其中一块板的位置,而乘员研究则改变了约束系统中的多个变量,例如假人与安全带之间的摩擦、安全带传感器的时间以及滑环的位置。
文章还未发现模型规模或加载工况强度与所需实验数量之间存在直接关系。决定性因素出现在使用同一组100次实验以及相同的三个设计变量训练预测器时。预测槛结构质量时,预测能力得分达到0.98;而预测受损电池单元数量时,该得分为0.64。
响应的性质决定学习难度
这种差异与物理学有关。质量是一种受板厚影响的平滑且近似单调的响应,而受损电池单元数量是一个整数值,其产生源于是否超过导致内部短路的特定应力阈值。微小的几何变化可能会使某个电池单元从未受损状态转为受损状态,也可能不会,从而要求模型学习许多彼此分离的边界位置。
这一模式在一项由60次实验组成的正面碰撞研究中再次出现。与有限元(FE)分析相比,侵入位置的预测误差介于0.9%和12.6%之间,而座椅安装点加速度的预测误差最高达到16.8%。文章将其归因于侵入量是一种更平滑的位移,而加速度是位移的二阶导数,包含高频成分。
输出丰富并不总是意味着需要更多数据
正面碰撞研究还给出了一个可能违反直觉的结果。基本数值的预测器需要全部60次实验,但二维曲线和三维场结果的预测器仅使用20次实验进行训练。这些场包括三个积分点处沿厚度方向的位移和塑性应变,以及每个时间步的数据。
文章给出的一个可能解释是,与处理单个数值的预测器相比,一次实验能够为场预测器提供多得多的训练数据。一次实验会在足部位置提供一个最大侵入量数值,但同时也会提供贯穿模型并覆盖所有时间点的相关空间场。
实验规划在实践中应如何改变?
文章提出的实用规则是:应根据最不平滑的响应来设计仿真活动,而不是根据输出形式最复杂的响应来设计。在承诺全部求解预算之前,文章建议先开展试验阶段并分析初始数据。
- 检查相关矩阵和散点图,以了解哪些变量驱动每一种响应。
- 使用预测能力得分,在0到1的范围内捕捉线性和非线性关系,以便在训练完整预测器之前评估响应的难度。
- 读取将数据规模与精度联系起来的学习曲线,以判断再增加20次实验是否有帮助,还是性能已经进入稳定阶段。
- 为每个预测关联误差界限;如果预测超出报告的界限或其置信区间,应将其视为需要进行新的求解的信号,而不是可靠答案。
- 使用设计变量重要性图,减少对影响较弱变量的投入,并将实验重新导向有影响的变量。
文章指出,25次实验与100次实验之间的差异,可能意味着显式求解时间和日历天数增加四倍。另一方面,过度缩减数据会导致验证失败并失去对该方法的信心,而数据规模过度扩大则会让人承担本可由学习曲线揭示为不必要的实验成本。
在一个应用示例中,预测器被用作响应面模型,通过500次迭代在几分钟内利用模拟退火算法驱动优化,因为损伤指标的预测耗时仅数秒,而不是每次迭代都运行完整仿真。
certi.news 解读
这里的核心价值并不是承诺机器学习模型将取消仿真,而是为分配实验预算提供了更好的标准:物理目标的难度比输入数量或输出丰富程度更重要。不过,文中结果来自一篇赞助博客文章,所展示的是特定研究,且现有文本未包含完整的方法学细节;因此,应将数据规模选择规则视为实验和验证的起点,而不是独立工程验证的替代方案,也不能替代对落在置信区间之外的情况进行求解。