当不同模型给出不同答案时,系统应该相信谁? ——从Verification、Validation到系统级仿真可信度

发布时间:2026/7/23 14:01:35
当不同模型给出不同答案时,系统应该相信谁? ——从Verification、Validation到系统级仿真可信度 在系统级物理光学中同一个元件、同一个输入条件可能存在多种不同的物理模型。一个模型可能采用标量近似。一个模型可能保留完整偏振信息。一个模型可能使用模态展开。另一个模型可能直接求解更加完整的电磁场。当这些模型给出相近结果时工程师通常比较容易做出判断。真正困难的情况是当不同模型给出不同答案时系统应该相信谁一个更复杂的模型是否一定更正确一个计算成本更高的模型是否天然更可信数值结果已经收敛是否意味着它描述了真实物理模型与实验数据高度吻合是否意味着它已经得到验证如果模型参数本身就是根据这组实验数据拟合出来的这种吻合又能说明什么这些问题说明仿真可信度不能简单来自模型名称求解器等级网格数量计算时间与某一次实验的表面一致。系统真正需要建立的是一条可追踪的证据链。这条证据链必须说明方程是否被正确求解模型是否适用于当前状态参数是否具有可靠来源实验数据是否包含已知不确定性不同模型之间的差异来自哪里当前证据是否足以支持最终系统目标哪些结论可以接受哪些仍然需要验证。因此系统级仿真可信度的核心不是找到一个绝对正确的模型。而是判断每一个模型在当前状态、当前目标和当前证据条件下究竟值得相信到什么程度。一、不同模型给出不同答案并不一定意味着其中一个错误当两个模型输出不同结果时人们很容易把问题理解为哪一个模型算错了但在很多情况下两个模型可能都正确实现了各自的数学假设。它们之所以给出不同答案是因为描述的物理范围并不相同。例如对于同一个光栅标量衍射模型可能忽略偏振耦合和纵向场分量。矢量模型可能保留这些效应。周期模型可能假设结构在横向无限重复。有限结构模型则可能包含边缘效应。理想几何模型可能假设表面完全光滑。制造模型则可能包含线宽波动、侧壁倾斜和粗糙度。因此模型差异可能来自物理假设不同边界条件不同参数不同输入场表示不同数值离散不同场接口不同信息压缩程度不同输出目标定义不同。所以系统面对模型分歧时第一步不应该是直接选择“更复杂”的那个。而应该先回答这些模型究竟在比较同一个物理问题吗如果两个模型的输入状态参考面坐标系偏振基边界条件材料参数目标量定义并不一致那么它们的结果差异可能没有直接比较意义。因此模型比较的前提不是结果格式一致。而是物理问题定义一致。二、系统必须先建立“差异来源诊断”当模型A和模型B给出不同答案时系统需要对差异进行分类。可以把模型差异概括为六类。1. 数值差异来自网格采样时间步长展开阶数模态截断迭代容差数值积分计算域截断。这类差异属于同一个数学模型是否被足够准确地求解。2. 模型形式差异来自标量与矢量近轴与非近轴薄元件与体传播周期结构与有限结构线性模型与非线性模型稳态模型与瞬态模型几何光学与波动光学。这类差异属于两个模型保留的物理机制不同。3. 参数差异来自折射率消光系数几何尺寸表面粗糙度温度应力材料色散制造偏差。这类差异属于模型输入是否描述了同一个真实对象。4. 边界条件差异来自入射场边界截断周期边界吸收边界端口定义无限空间假设对称条件。边界条件即使发生很小变化也可能导致共振、模态和散射结果发生明显改变。5. 接口差异来自参考面不一致相位约定不同偏振基不同功率归一不同模态排序不同场重采样坐标变换近远场转换。这种差异并不来自元件模型本身而来自模型之间的连接过程。6. 信息表示差异来自复振幅与强度矢量场与标量场连续场与有限模态近场与远场确定性场与统计量内部场与散射矩阵。这种差异意味着两个模型可能根本没有输出同等完整的信息。因此模型结果不同不等于模型正确性不同。系统必须先知道差异属于哪一类才能决定下一步行动。三、Verification回答的是模型有没有被正确地算出来Verification通常被翻译为“验证”或“数值验证”。但为了避免与Validation混淆更准确地说它回答的是数学模型是否被正确实现和正确求解它关注的是方程有没有写对代码有没有实现正确数值算法是否收敛离散误差是否受控守恒关系是否满足边界条件是否正确施加模型接口是否保持一致。Verification并不直接回答模型是否符合现实。它只回答在既定假设下计算是否忠实地执行了这个模型。例如一个标量衍射模型可能被实现得完全正确。网格收敛良好。能量守恒也满足。但如果系统中存在强烈的偏振耦合标量模型仍然可能无法描述真实结果。这并不是Verification失败。而是模型适用性问题。因此必须明确数值上正确不等于物理上充分。四、数值收敛不等于物理正确在工程计算中人们经常把网格收敛视为可信度的核心证据。网格收敛确实非常重要。如果结果随着网格变化明显波动那么当前计算显然不稳定。但网格收敛只能说明数值解正在趋近于当前数学模型的解。它不能证明当前数学模型正确描述了现实。一个忽略关键偏振效应的模型可以高度收敛。一个错误设置材料参数的模型也可以高度收敛。一个使用错误边界条件的模型同样可以稳定收敛。所以收敛意味着计算稳定地接近某个答案。但这个答案是否代表真实物理还需要其他证据。系统不能把Numerical Convergence直接等同于Physical Correctness五、Verification不只发生在求解器内部在系统级物理光学中Verification不能只检查单个模型。因为即使每一个元件模型都被正确实现模型之间的连接仍然可能出错。例如前一个模型输出的是某参考面上的场后一个模型却把它理解为另一个参考面上的场。或者前一个模型使用固定x/y偏振基后一个模型要求局部s/p偏振基。又或者两个模型对功率的归一方式不同相位时间约定相反模态编号顺序不一致。这些错误可能不会导致程序崩溃。系统仍然可以给出一个看似合理的结果。但这个结果在物理上已经失去意义。因此系统级Verification至少包含四个层次代码Verification数值Verification模型接口Verification系统集成Verification。这意味着系统不仅要证明每一个模型算得对。还要证明这些模型连接得对。六、Validation回答的是模型是否能够描述现实Validation关注的不是代码是否正确而是当前模型在特定现实条件下是否具有足够的预测能力这通常需要把模型结果与实验或真实系统数据进行比较。但Validation并不是简单地看两条曲线是否接近。一个完整的Validation问题至少需要明确验证对象是什么验证工作状态是什么验证目标量是什么实验不确定性是多少模型参数来自哪里比较指标是什么验证结论适用于什么范围。因此一个模型不能被简单地标记为已验证。更加准确的说法应该是该模型在某一组工作条件下对某一类目标量获得了某种程度的实验证据支持。例如一个模型可能已经验证了正入射条件下的总透射效率但没有验证大角度入射下的偏振串扰局部近场增强制造误差条件下的稳定性宽带状态下的相位响应。所以Validation永远具有目标性和适用域。七、模型与实验吻合并不自动意味着模型有效假设一个模型与实验数据高度一致。这种一致性可能来自多种原因。第一种可能是模型确实保留了主要物理机制。第二种可能是模型参数被调整到能够匹配这组数据。第三种可能是不同误差彼此抵消。第四种可能是实验只覆盖了一个很窄的工作范围。第五种可能是比较的目标量对缺失物理并不敏感。第六种可能是测量不确定性太大无法区分模型差异。因此一次吻合只能构成证据不能自动构成完整Validation结论。Validation真正关心的是模型是否具有跨状态能力跨样本能力跨目标能力预测未参与校准数据的能力。如果一个模型只能解释自己已经见过的数据却无法预测新的工作状态它的工程价值仍然有限。八、Calibration不等于ValidationCalibration是根据数据调整模型参数使模型输出与观测结果更加一致。例如可以调整材料折射率几何尺寸表面粗糙度边界修正参数代理模型系数经验校正项。Calibration可以写成寻找一组参数使模型结果与已有数据尽可能接近。这对工程非常有价值。但Calibration并不能替代Validation。因为经过校准的模型可能只是对已有数据实现了拟合。如果使用同一组数据完成参数调整又用同一组数据证明模型有效就会形成循环论证。因此校准数据与验证数据应尽可能独立。更重要的是校准只能调整模型中已经存在的自由度。如果模型缺失了关键物理仅仅通过调整参数可能在某个狭窄区域拟合结果却无法在其他状态下继续成立。所以Calibration ≠ Validation校准回答的是参数应该取什么值Validation回答的是这个模型在新条件下是否仍然具有预测能力九、过度校准可能掩盖模型形式错误在复杂模型中如果可调参数很多模型通常可以很好地拟合有限实验数据。但这并不一定是好事。因为多个参数可能相互补偿。例如错误的材料参数错误的几何尺寸错误的边界修正可能组合出一个看似正确的输出。此时模型虽然与实验吻合但内部物理解释已经失真。这种现象可以被理解为参数补偿掩盖了模型形式错误。如果模型被用于新的波长、角度、偏振或几何条件这种补偿关系可能迅速失效。因此Calibration必须同时考虑参数可辨识性参数相关性参数物理合理性校准范围外推风险独立验证。系统不能只问模型能不能拟合数据还必须问这组参数是否具有稳定、可解释和可迁移的物理意义十、High Fidelity不等于Ground Truth在多保真体系中高保真模型通常被用来校准或验证低保真模型。这种做法是合理的。但必须避免一个常见误区高保真模型不是天然真值。高保真模型可能采用更完整的方程更细的离散更严格的边界条件更高维的场表示。但它仍然可能存在数值误差材料参数误差几何误差边界条件误差代码实现错误物理机制遗漏计算域截断实验状态不一致。因此High Fidelity ≠ Ground Truth更加准确的理解是高保真模型通常是一个物理机制更加完整、但仍然需要Verification和Validation的证据源。它可以作为比较基准校准来源趋势参考局部物理解释低保真误差估计依据。但不能被无条件视为最终真值。十一、实验也不是无误差真值如果高保真模型不是真值那么实验是不是实验当然是非常重要的物理证据。但实验同样存在不确定性。例如仪器分辨率标定误差探测器噪声环境温度机械漂移样品批次差异入射场不确定性光源稳定性数据处理算法测量窗口限制。对于相位、近场、偏振和相干性测量还可能存在相位恢复歧义参考光误差探针扰动有限数值孔径偏振消光比限制动态范围不足。因此实验不应只是一个数字或一条曲线。一个完整的实验数字对象应包含MeasurementUncertaintyContext即测量值测量不确定性实验条件仪器信息标定状态样本信息数据处理过程可观测范围。所以实验是高价值证据但不是无误差的绝对真值。十二、模型与实验的比较必须考虑双方不确定性假设模型预测为P实验测量为M。仅仅计算|PM|并不能完整判断两者是否一致。因为模型预测可能具有不确定性U_model实验测量也可能具有不确定性U_exp如果差异小于双方综合不确定性范围那么模型与实验可能是统计一致的。如果差异明显超出综合不确定性范围才说明当前模型、参数或实验条件之间存在值得调查的冲突。因此Validation不是比较两个确定数字。而是比较两个带有不确定性的证据对象。系统真正要判断的是模型与实验的差异是否超出了当前证据所能解释的范围十三、不同证据具有不同作用系统级仿真可信度不应依赖单一证据。它应由多类证据共同构成。这些证据至少包括数值证据例如网格收敛模态收敛时间步长收敛守恒关系残差数值稳定性。它支持的是当前计算是否可靠地求解了选定模型。基准证据例如解析解标准算例文献基准极限情况对称性守恒定律。它支持的是模型或代码在已知问题上是否表现正确。跨模型证据例如低保真与高保真比较不同数值方法比较不同模型层级比较独立实现比较。它支持的是不同建模假设下结果是否具有一致趋势。实验证据例如元件测试子系统测试整机测试环境测试制造样本测试。它支持的是模型与现实系统之间是否存在可接受一致性。历史证据例如相似元件历史数据既往项目制造数据库运行数据已验证参数区间。它支持的是当前模型是否处于已经积累经验的区域。物理一致性证据例如能量守恒互易性因果性对称性被动性热力学约束。它支持的是结果是否满足基本物理规律。这些证据的作用不同不能简单互相替代。例如数值收敛不能替代实验Validation。实验吻合也不能证明代码实现没有错误。跨模型一致也可能意味着多个模型共享了同一个错误假设。因此可信度需要多源证据共同支持。十四、系统相信的不是模型而是证据链基于前面的讨论可以得到一个核心结论系统不应该无条件相信任何一个单一模型。系统应该相信的是一条由数值、物理、实验和历史证据共同构成的证据链。这条证据链可以表示为Evidence Chain其中包括模型假设参数来源数值收敛基准测试交叉模型比较实验验证不确定性范围适用域历史记录决策结果。因此Trust ≠ Model Label而更接近Trust EvidenceApplicabilityConsistencyUncertainty其中Evidence表示当前拥有多少证据Applicability表示证据是否覆盖当前状态Consistency表示不同证据是否相互支持Uncertainty表示仍然存在多大的未知范围。十五、可信度必须与目标绑定一个模型不应该拥有一个脱离任务的固定可信度分数。因为同一个模型对不同目标可能具有不同表现。例如一个光栅模型可能能够准确预测总透射效率但无法准确预测偏振串扰相位响应局部近场高阶衍射通道。同样一次实验可能验证了能量效率却没有测量相位。那么这组实验不能直接为相位预测提供同等强度的证据。因此可信度必须与具体目标量绑定。可以概括为Credibility f(Model, State, Goal, Evidence)也就是说可信度取决于使用了什么模型当前处于什么状态关心什么目标拥有什么证据。所以不应该说这个模型可信度是90%。更加准确的表达是该模型在当前工作条件下对目标J的预测具有较高证据支持。十六、可信度还必须与状态绑定即使一个模型在某个区域经过充分验证也不能自动外推到所有区域。例如一个模型可能只在以下范围内获得验证波长500—600 nm入射角0—10°温度20—30°C固定偏振特定制造公差范围。当系统进入更宽波段更大入射角不同偏振更高温度新材料批次原有证据的适用性会下降。因此模型可信度必须包含适用域。当状态位于验证区域内部时可信度较高。当状态靠近边界时可信度需要降低。当状态进入明显外推区域时系统必须请求额外验证调用更高保真模型增加不确定性或拒绝给出高可信结论。所以可信度不是模型固有属性而是模型与当前状态之间的关系。十七、局部可信度如何形成系统可信度到目前为止我们讨论的大多是单个模型的可信度。但系统级物理光学真正关心的是每一个局部模型的证据如何共同形成最终系统目标的可信度假设一个系统包含光源模型传播模型光栅模型透镜模型探测器模型。即使其中四个模型都具有很高可信度只要某一个关键模型超出适用域接口未经验证丢失关键相位参数来源不明最终系统结果的可信度就可能显著下降。因此系统可信度不能简单取所有局部可信度的平均值。它更可能受到最弱关键环节最高敏感度环节证据缺失环节信息不可逆损失环节共同控制。可以概括为系统可信度取决于证据薄弱环节是否位于目标敏感路径上。一个低可信度模型如果对目标几乎没有影响系统结果仍可能可信。一个局部误差很小但对目标极度敏感的模型则可能主导整个系统风险。所以局部可信度必须与目标敏感度结合。十八、系统可信度不是简单相乘或取最小值在概念层面人们可能尝试用一种简单公式计算系统可信度。例如所有模型可信度相乘取最低可信度计算平均可信度。这些方法通常过于粗糙。因为不同模型对目标的影响程度不同证据类型不同误差可能相关证据可能重复不确定性可能互相抵消或放大。例如两个模型都使用同一个材料数据库。它们的结果一致并不代表获得了两份独立证据。它们可能共享同一个参数偏差。因此系统可信度评估必须考虑目标敏感度证据独立性误差相关性状态适用性信息完整度接口可靠性。这意味着可信度传播本身也需要一个模型。而不是简单的分数运算。十九、模型接口也必须拥有独立证据在传统Verification与Validation框架中人们通常关注模型本身。但在系统级物理光学中接口具有同等重要性。例如矢量场如何投影到模态模态如何进入端口近场如何转换为远场固定偏振基如何转换为局部偏振基高保真场如何压缩为散射矩阵不同采样网格如何重构。这些接口都包含物理假设与数值操作。所以它们也必须经过数值Verification基准测试反向一致性检查守恒检查误差估计适用域确认。因此证据链中不能只有Model Evidence还必须包含Interface Evidence一个模型本身即使非常可信如果接口未经验证最终系统结果仍然可能不可信。二十、信息压缩会削弱后续验证能力上一篇文章中我们讨论了信息压缩。例如复振幅压缩为强度矢量场压缩为标量场连续场压缩为有限模态内部场压缩为散射矩阵。这些操作不仅会影响后续物理计算。还会影响后续可信度判断。例如如果系统只保留强度就无法再验证相位。如果只保留远场就无法再检查局部近场热点。如果只保存少量模态就无法判断被截断模态是否在后续重新耦合。因此信息压缩也会压缩证据能力。这意味着系统在决定压缩场信息时还必须考虑未来是否仍然需要利用这些信息进行验证、诊断或追溯所以Information State不仅影响物理传播。它还影响Evidence Chain。二十一、可信度必须能够解释“为什么”一个成熟的可信度系统不能只输出Credibility High因为这种标签无法支持工程审查。系统必须能够解释哪些证据支持这个结论哪些证据仍然缺失当前状态是否处于验证范围结果主要依赖哪些模型哪一个环节风险最高模型之间是否存在未解释差异哪种额外验证最有价值。例如一个系统可以输出当前总透射效率预测可信度较高。原因关键元件模型完成网格收敛能量守恒误差低于阈值模型在当前波长和角度范围内具有实验验证接口功率归一已完成独立基准测试。限制偏振相位尚未验证因此该可信度结论不适用于偏振串扰预测。这样的输出才真正具有工程意义。二十二、系统需要维护Evidence Object为了让证据可追踪每一项证据都不应只是一个备注。它应该成为一个结构化数字对象。一个Evidence Object至少应包含证据类型支持的模型支持的目标量覆盖的工作状态数据来源不确定性独立性时间信息校准状态是否仍然有效。例如一次实验不能只保存为Measured Efficiency 82%而应保存为测量值82%测量不确定性±1.5%波长532 nm入射角5°偏振TE温度23°C样品批次B02仪器某型号功率计最近标定时间数据处理方法支持目标一级衍射效率不支持目标相位与局部近场。这种Evidence Object才能被系统正确使用。二十三、证据也具有有效期模型、实验和制造环境都可能发生变化。例如材料数据库更新制造工艺改变样品批次改变仪器重新标定模型版本升级接口算法变化工作范围扩展。这意味着旧证据可能不再完全适用于新模型或新状态。因此证据必须具有版本和有效性。系统需要知道这项证据支持哪个模型版本支持哪个参数范围是否仍然覆盖当前状态是否因模型更新而失效是否需要重新验证。可信度不是静态存档。它是一个会随着模型、数据和系统状态变化而更新的动态对象。二十四、可信度不足时系统应该采取什么行动如果系统发现当前证据不足它不应该简单继续计算并输出一个看似确定的结果。它应该给出明确行动。例如Accept当前误差、适用域和证据均满足目标要求。结果可以用于当前工程决策。Refine问题主要来自数值误差。系统应增加网格、采样、模态数或迭代精度。Upgrade问题来自模型形式不足。系统应采用更完整的物理模型。Validate当前数值结果稳定但缺乏现实证据。系统应请求实验、历史数据或独立高保真比较。Recalibrate模型结构基本可信但参数已经不适用于当前状态。系统应重新校准参数。Reject当前模型超出适用域证据不足且无法可靠估计误差。系统应拒绝输出高可信结论。因此可信度系统的最终目的不是生成一个分数。而是支持下一步应该做什么。二十五、可信度也应进入计算资源分配实验、验证和高保真计算都需要成本。所以系统还要判断哪一种新增证据最值得获取例如当前系统风险可能来自某个元件参数不确定某个接口缺少基准某个模型超出验证域某个高敏感目标缺少实验数据。系统可以评估不同证据的收益证据收益 预计风险下降 ÷ 获取证据的成本如果一次局部实验能够显著缩小系统不确定性它可能比继续增加网格更有价值。如果一次高保真计算只能轻微改变低敏感元件结果它的优先级可能较低。因此系统不仅调度计算模型。它还可以调度验证任务实验任务数据采集参数测量模型比较。这意味着平台优化的不只是Computation Path。还包括Evidence Acquisition Path二十六、多目标系统可能拥有不同的可信度结论同一个系统结果不同目标可能拥有不同可信度。例如一个成像系统可能对总功率预测具有高可信度MTF预测具有中等可信度偏振串扰预测具有较低可信度杂散光尾部预测证据不足。这并不矛盾。因为不同目标依赖不同物理信息经过不同传播路径对不同元件敏感拥有不同验证证据。所以系统不能只输出一个整体“模型可信”标签。它应针对每个重要目标分别输出预测值不确定性可信度证据适用范围风险来源。这才符合Goal-Oriented Credibility。二十七、系统最终应该输出什么传统仿真通常输出一个结果J更加完善的系统可能输出JError但系统级物理光学还需要进一步输出JUncertaintyCredibilityEvidenceDecision其中J表示系统目标预测。Uncertainty表示结果可能波动或偏差的范围。Credibility表示当前证据对该结果的支持程度。Evidence表示可信度来自哪些数值、实验和历史证据。Decision表示结果可以接受、需要改进、需要验证还是应该拒绝。这与我们前面建立的数字物理对象形成完整闭环。一个智能数字模型不只是计算输入场 → 输出场它还需要做出判断当前结果是否值得相信以及下一步应该采取什么行动。二十八、从FieldTrust走向Evidence-Grounded Decision此前我们提出系统级物理光学需要同时传播两条链。第一条是Field Chain。第二条是Trust Chain。现在可以进一步明确Trust并不是一个抽象分数。它必须由Evidence支撑。因此系统真正传播的是FieldErrorInformation StateEvidence这些信息共同形成Credibility最终支持Decision整个逻辑可以概括为Field描述系统预测了什么。Error描述结果可能偏差多少。Information State描述当前场还保留了什么。Evidence描述为什么可以相信这个预测。Decision描述系统下一步应该做什么。这使系统级物理光学不再只是一个计算平台。它开始成为一个能够形成物理判断的数字系统。结语系统不应该相信“最高等级”而应该相信可追踪证据当不同模型给出不同答案时最简单的做法是选择最复杂、最昂贵的模型。但这种做法并不能真正解决可信度问题。因为高保真模型也可能存在错误数值收敛不等于物理正确实验数据也包含不确定性校准结果不能自动证明预测能力局部模型可信不等于系统连接可信模型标签不能替代证据链。因此系统不应该问哪一个模型等级最高而应该问哪一个模型被正确求解哪一个模型适用于当前状态哪一个模型保留了当前目标所需的物理哪一个模型拥有更直接、更独立的证据哪些差异仍然无法解释当前证据是否足以支持工程决策。真正成熟的系统不会无条件相信某一个模型。它相信的是一条经过Verification、Validation、Calibration和Uncertainty Quantification共同支撑的证据链。这条证据链必须能够说明结果从哪里来参数从哪里来模型在哪些条件下成立误差如何估计实验如何支持接口是否可靠信息是否完整当前结论适用于什么范围。因此系统级仿真可信度的最终目标不是证明模型永远正确。而是明确回答在当前目标、当前状态和当前证据条件下这个结果是否足以支持决策系统最终相信的不是某一个模型。也不是某一次实验。更不是某一个精度标签。系统相信的是一条可以被检查、被追踪、被更新也可以被质疑的证据链。当仿真平台能够建立这条证据链时FieldTrust才真正完整。系统输出的也不再只是一个光学结果。而是一个有证据支撑的物理判断。下一篇预告当系统能够判断结果是否可信后下一个问题是系统如何把这种可信判断转化为实际工程决策当计算预算有限时平台应该优先细化哪个模型应该增加一次高保真计算还是安排一次实验应该继续优化设计还是先补充证据下一篇我们将进一步讨论系统如何决定下一步最值得做什么——从可信度评估走向主动验证与计算资源分配这将进一步建立Value of InformationActive ValidationEvidence AcquisitionVerification Planning计算、实验与模型升级之间的联合资源调度。系统将不再只是被动报告不确定性。它将开始主动决定为了提高最终预测能力下一步最值得获得什么信息。