本文根据云境智仿 CEO 朱飞博士在第22届中国CAE工程技术年会的专题报告整理而成,部分内容有删减。如需获取完整报告 PPT,请后台私信领取。

传统多物理场仿真的三大根本性瓶颈
以CFD、FEA为代表的传统数值仿真,物理严谨、精度可靠,但存在无法突破的结构性瓶颈,极大限制了工业智能化落地。
1. 高计算成本与实时性困境
传统方法依赖网格生成、矩阵组装和迭代求解,计算复杂度随问题规模超线性增长。一个整车有限元模型的单次仿真往往需要数小时甚至数天,多物理场耦合进一步加剧了负担。这就导致实时仿真、数字孪生和在线优化这些工业界迫切需求的应用场景,在传统框架下几乎遥不可及。
2. 复杂几何与多尺度耦合难题
复杂结构的高质量网格生成高度依赖专家经验,网格质量直接影响精度。而多尺度问题跨越多个数量级,传统方法很难在单一框架内高效处理。一个细微的几何特征变化,就可能导致关键物理现象的预测失真。
3. 参数化设计与逆向优化能力受限
传统仿真是正向线性流程:参数变了,就得重新执行完整仿真。这种”逐点计算”模式使大规模参数扫描极其昂贵。逆向问题更麻烦,需要专门的伴随方程求解器或MCMC采样,代价非常高昂。
这三大瓶颈共同指向一个核心需求:我们需要一种能够打破正向-逆向壁垒、实现”仿真即生成”、同时保证物理一致性的新型计算范式。
AI赋能的智能化仿真求解,正是突破这一困境的关键路径。而”仿真大模型”,正是回应这一需求的前沿探索方向。
大模型带来的仿真范式革命启示

那么,大模型技术的发展给我们带来了哪些范式启示呢?主要有三点:
第一,规模定律与涌现能力。 GPT系列证明,大规模预训练可以自发习得数据中的深层结构和抽象规律,无需显式编程。这启示我们:如果让模型在海量物理仿真数据上充分训练,它或许能自发”领悟”物理规律。
第二,上下文学习机制。 GPhyT等最新研究证明,模型可以从输入的简短序列自动推断控制动力学,实现不同物理系统的统一建模。这意味着模型不需要为每个新系统重新训练,而是通过”提示”就能适应新的物理场景。
第三,生成式范式的拓展。 从”预测下一个Token”到”预测下一个物理状态”,自回归生成正在向连续物理世界拓展。
产业界也在快速布局。Google DeepMind在2025年成立了专项团队,由前Sora负责人Tim Brooks领衔,开发能”模拟整个世界”的生成式模型。NVIDIA推出了Cosmos世界基础模型,专门设计用于理解物理世界并生成具有物理感知的视频内容。华为盘古气象预测模型通过三元组Transformer架构,速度比传统NWP快数万倍。字节跳动的Seedance 2.0内置物理模拟引擎,能处理液体飞溅、织物摇曳和碰撞反弹。
核心趋势是:AI正从语言智能向物理智能跃迁。 通过在视频和多模态数据上进行大规模训练,AI可以构建对世界运作方式的内部表征,进而推理行为的后果。这被认为是实现AGI的关键路径。
世界模型的定义与核心特征
核心定义:世界模型是存在于AI系统中的世界模拟器,能够学习环境在时间和空间上的压缩表征,并能据此预测未来状态的内部神经网络系统,可通过模型自我模拟实现自我进化。
它有四大关键特征:
- 状态压缩——将高维感官输入编码为紧凑的潜在表示,只保留最核心信息
- 动态预测——给定当前状态,预测下一状态,也就是”即将发生的事”
- 行动条件化——支持交互式预测,以当前状态和控制输入为条件
- 可进化性——通过模型自我模拟,也就是”梦境”,实现自我进化
这里要特别强调世界模型与LLM的本质区别:LLM学习的是语言的结构,预测句子中的下一个词,处理的是离散符号序列。而世界模型学习的是因果关系的结构,预测下一个物理状态,处理的是连续时空数据。行动是世界模型的终极压缩——世界模型以行动为条件进行预测。
世界模型主流技术分类
按「核心架构」分类:

自回归生成式世界模型:
- 核心思想:将物理场离散Token化,适配大模型生态,概率建模自然。
- 代表工作:PhysiX、GPhyT和IRIS
- 优点:概率建模自然,与LLM基础设施兼容
- 缺点: 局限是序列生成慢,长程依赖有挑战。
扩散模型式世界世界模型:
- 核心思想:通过逐步去噪过程生成物理场,支持物理约束引导。
- 代表工作:DreamPhysics(MDS+MPM)、PCDM(投影修正)、PIDM(PDE残差损失)
- 优点:生成质量高,支持灵活引导
- 缺点:多步采样推理慢
JEPA架构世界模型:完全绕过像素空间,在潜在表示层面进行预测。
- 代表工作:I-JEPA、Video JEPA
- 优点:避免生成式模型的”模糊”问题,计算高效
- 缺点:潜在空间物理可解释性不足
对比来看,自回归在离散Token空间操作,物理约束间接,推理慢;扩散在连续潜在空间操作,物理约束直接,推理也慢;JEPA在紧凑潜在空间操作,物理约束间接,但推理最快。
按「应用领域」分类:

- 游戏/虚拟环境:在可控虚拟环境中学习策略与动态,代表有Dreamer V3、IRIS、MuZero。特点是清晰奖励信号、一致物理规律、可控实验环境。
- 机器人/具身智能:视觉-语言-行动结合,支持真实世界交互,代表有RT-2、π0、SIMA。需要大量机器人数据。
- 科学仿真:面向PDE约束的物理系统精确模拟,代表有GPhyT、PhysiX、盘古气象。需要满足守恒律和边界条件,数值精度要求高。
- 视频生成:从海量视频数据中学习物理常识,代表有Sora、Cosmos WFMs、Seedance 2.0。重视觉效果轻物理逻辑,物理一致性待提升。
这四类模型的交汇点,引出了”仿真世界模型”的概念。
仿真世界模型是科学仿真世界模型与视频生成世界模型的融合交汇点:
它既要有物理严格性——满足PDE约束、守恒律和边界条件,保证数值精度;又要有生成灵活性——支持条件生成、多尺度建模和跨领域迁移;还要有视觉真实性——生成结果兼具物理正确性与视觉真实感。
它的关键价值在于,成为连接数字世界与物理世界的智能桥梁。
物理融合智能仿真五大核心技术路径

1. 路径一:物理信息神经网络(PINNs)

- 核心思想:是将PDE残差作为正则化项嵌入神经网络损失函数,通过自动微分计算输出对输入的各阶导数,构造物理约束项。
- 优势:无网格特性,几何灵活性高,逆问题可以端到端求解。
- 局限:高频和多尺度问题训练困难,损失权重调参复杂,长时间积分不稳定。
PINNs正在向「物理约束扩散模型」演进。
- PCDM(物理约束扩散模型),在反向扩散的每一步迭代中,将神经网络预测的场估计显式投影到满足不可压缩性(∇·u=0)的物理可容许子空间。
- PIDM(物理信息扩散模型),则将PDE残差项直接嵌入扩散模型的训练目标函数,使模型在训练阶段就学习物理规律。
关键突破在于:从”软约束”(损失函数惩罚)到”硬约束”(投影保证严格满足)的跨越
2. 路径二:神经算子学习(FNO & DeepONet)
- 核心目标:学习无限维函数空间之间的非线性算子 G:A→U,实现离散化无关性——在粗糙网格上训练,在精细网格上预测。
- FNO,傅里叶神经算子,通过在傅里叶空间执行核积分卷积,成功捕获了全局依赖关系。但在处理复杂几何边界或局部剧烈变化时,容易出现过度平滑的问题。
- DeepONet,通过支路网络和主干网络的乘积和来近似算子,但在处理多尺度物理交互时面临泛化挑战。
- UPT,通用物理变换器,引入了”编码-近似-重构”框架,利用学到的神经表示作为输入和输出函数分布的基函数,保持离散化无关性。它通过几何切片平铺和矩阵乘法结合律优化,显著降低了Transformer注意力的二次复杂度,使单GPU大规模CFD仿真成为可能。
3. 路径三:几何深度学习(GNN & 等变网络)

核心思想:对称性即归纳偏置。 几何深度学习处理非欧几里得域上的物理问题,将对称性、不变性和拓扑约束嵌入网络架构。
GNN消息传递机制: 节点代表空间离散点,边代表物理连接,迭代消息传递模拟物理影响扩散——这与有限体积法的stencil操作有深刻类比。
等变网络设计: 利用群论保证物理对称性约束,比如SE3等变性,减少数据需求并保证变换一致性。
代表性技术:
- Whitney Forms: 学习神经场定义有限元空间,严格保证拓扑结构与物理守恒;
- Fibration Symmetries:允许局部同构输入树的对称性,提高对非对称扰动的鲁棒性;
- Graph Transformers: 将全局注意力扩展至图结构,捕捉远距离几何交互与动力学耦合。
工业应用方面,Altair PhysicsAI 利用几何深度学习处理3D网格数据,实现比传统求解器快1000倍的预测,覆盖结构、流体、热、电磁多物理场。
4. 路径四:物理基础模型
4.1 GPhyT

GPhyT架构:神经微分器 + 数值积分器混合设计
GPhyT代表了基于Transformer的神经微分器路径。其核心架构创新包括:
- 神经微分器——Transformer预测物理状态的时间导数;
- 数值积分器——Forward Euler方法外推未来状态,注意这里论文验证RK4并没有显著优势;
- 时空Tubelet Token化——时间维度显式纳入Token结构;
- 有限差分导数拼接——输入端显式计算空间和时间导数,增强对局部梯度和突变的敏感性。
GPhyT的上下文学习机制非常强大:从4个连续快照就能自动推断底层控制动力学——速度场涡旋对应Navier-Stokes动力学,温度对流卷对应Rayleigh-Bénard对流,密度场间断对应Euler方程激波结构。
训练规模方面,GPhyT在1.8TB数据上训练,覆盖8类物理系统,7100万+训练样本,240万条轨迹。关键成果包括50步自回归推演稳定,以及零样本泛化到新物理系统。在The Well基准上,GPhyT比传统FNO的MSE降低了超过7倍。
4.2 Transolver系列。
Transolver是工业级几何的Transformer求解器,核心架构创新有三点:
- Geometry Slice Tiling——将复杂几何切片平铺,降低注意力二次复杂度;
- Learnable Physics Attention——可学习的物理注意力替代标准自注意力;
- Amortized Training——摊销训练策略,单GPU即可处理大规模CFD。

Transolver-3架构:Faster Slice/Deslice + Geometry Slice Tiling + Amortized Training
Transolver-3进一步扩展到真实工业级复杂几何,包括汽车、飞机外形。它通过Faster Slice/Deslice算法实现线性复杂度缩放,在相同精度下速度比传统FNO快10到100倍。

Transolver vs DeepONET vs CNO vs PFT-CNO在流场高度和速度预测上的对比
Transolver系列标志着Transformer架构从通用机器学习工具向专用物理仿真引擎的转变。通过几何切片平铺和摊销训练,它首次实现了在单GPU上对工业级复杂几何的高效物理仿真,为船舶等复杂工程几何的AI仿真提供了可行路径。
4.3 PhysiX

PhysiX采用了完全自回归的生成架构,参数量达到4.5B。
它包含三大核心组件:
- 通用离散Tokenizer——将连续时空场压缩为离散Token序列,实现跨尺度特征对齐;
- 自回归生成模型——4.5B参数,”预测下一个Token”学习物理场时空演化,因果掩码保证顺序依赖;
- 精细化模块——补偿量化误差,恢复高频物理细节,基于像素空间上下文修正预测。
PhysiX的一个重大突破是视频先验迁移:从NVIDIA Cosmos视频生成模型初始化权重,将自然视频中的物理常识——物体运动规律、重力效应、碰撞响应——迁移到严格物理仿真中。
这破解了科学仿真数据匮乏的难题,实现了跨域知识迁移。
从实验数据看,PhysiX在长程预测上的VRMSE显著优于基线方法,在shear_flow、rayleigh_benard等典型物理系统上表现突出。
5. 路径五:世界模型与视频扩散先验——DreamPhysics。

DreamPhysics提出了“属性学习”范式。
区别于直接优化形变场的策略,它从视频扩散先验中学习物质场的物理属性——密度、弹性模量、塑性参数等——再将学习到的属性输入MPM物理引擎进行动力学演化。物理属性作为物质的本征特征,具有时间不变性和场景泛化性。
核心技术:运动蒸馏采样(MDS)
传统SDS关注视觉外观而非运动动力学。MDS重新设计蒸馏目标:显式抑制颜色信息干扰,强化运动信息梯度信号,进行时序维度光流评分估计。
技术流程:
3D Gaussian静态场景表示 → MPM Simulator物质点法仿真 → Video Rendering渲染视频序列 → Video Diffusion MDS蒸馏优化,端到端可微分梯度回传优化物理属性。
核心优势:
- 物理一致性保证:MPM确保每帧满足质量、动量、能量守恒;
- 多条件支持:图像加文本条件输入,灵活的4D内容创作;
- 神经-数值协同:神经网络提供语义理解,数值仿真保证物理精度和计算效率。
这五大路径正在呈现明显的融合趋势:算子学习与Transformer结合,扩散模型与物理约束融合,几何深度学习与基础模型结合,视频先验与物理仿真结合,自回归与离散Token化结合。这种融合正是仿真世界模型诞生的技术土壤。
各方法路径对比分析
先看仿真世界模型与传统神经代理模型的对比:

传统神经代理模型局限于单一物理系统和特定边界条件,需要从零开始的任务特定训练,显式要求控制方程作为惩罚项,数据规模在万级到十万级快照,典型架构是CNN、FNO、UNet,核心能力是特定任务的快速推理替代。
而仿真世界模型支持跨领域、多物理场耦合、任意几何,采用大规模预训练加任务自适应微调,隐式从上下文数据中学习动力学规律,数据规模达到TB级多样化仿真数据集,典型架构是Transformer和自回归生成模型,核心能力是上下文学习、零样本泛化和跨系统迁移。
再看五大技术路径的横向对比:

从生成范式看,自回归与LLM兼容但串行慢,扩散质量高但采样步数多,流模型单步最快但表达能力受限。从表征空间看,连续空间任意分辨率但导数计算直接,离散空间与生成模型兼容但有量化误差,混合空间兼顾双方优势。从物理约束方式看,软约束灵活但无严格保证,硬约束理论保证强但开销大,无约束灵活性最高但一致性弱。
仿真世界模型的核心定位

仿真世界模型位于科学仿真世界模型与视频生成世界模型的交汇点。
科学仿真世界模型:如GPhyT、PhysiX、盘古气象,强调物理严格性——满足PDE约束、守恒律严格保证、边界条件精确施加、数值精度可控。
视频生成世界模型:如Sora、Cosmos、Seedance,强调生成灵活性——条件生成能力、多尺度建模、跨领域迁移、端到端可微分。
仿真世界模型要同时满足三重要求:
物理严格性、生成灵活性、视觉真实性。
与现有范式的区别在于:相比纯科学仿真模型,它引入生成式范式的端到端能力和视频先验的物理常识,突破传统求解器的线性流程限制;相比纯视频生成世界模型,它嵌入物理约束确保动力学严格性,不仅追求视觉逼真,更保证数值精度和守恒律满足。
它的关键价值在于:成为连接数字世界与物理世界的智能桥梁。
仿真世界模型的关键瓶颈与未来方向
五大关键瓶颈:
- 长时程稳定性。 自回归误差累积,目前50步稳定与工程需要的数百万步还有巨大差距。
- 多物理场耦合隐式协调。 不同物理场的时间、空间尺度差异巨大,如何实现高效耦合是核心难题。
- 三维复杂几何高效处理。 工业级几何Token化成本与精度的权衡尚未解决。
- 物理真实性与视觉真实性差距。 表观运动模式与动力学正确性之间仍存在鸿沟。
- 训练数据获取成本。 物理仿真数据生成成本极高,多精度策略是缓解方向。
未来研究方向:
- Transformer上下文加算子学习:GPhyT已展示隐式算子学习,未来需显式函数空间结构。
- 扩散模型与物理约束深度融合:将守恒律嵌入扩散方程,设计内在保持守恒的扩散过程。
- 自适应Token化加多尺度表示统一:时空联合自适应,实现计算资源最优配置。
- 神经-数值混合推理模式:模型高置信度区域快速生成,低置信度区域调用传统求解器。
- 物理驱动的自主科学发现:在隐空间进行海量物理方案快速筛选和梯度优化。
总结
仿真大模型正处于从”黑盒代理”向”通用世界模型”跃迁的奇点。
通过融合算子学习的数学广度、几何深度学习的结构深度、物理信息引导的严谨性以及视频扩散先验的物理常识,人工智能正在构建一套能够直接理解并模拟物质世界规律的全新技术体系。
物理仿真大模型不仅是科学研究的加速器,更是工业智能化转型的底座。
如果您想进一步了解云境智仿的产品和服务,不用犹豫,请随时联系我们。
📧邮件:marketing@simversus.com
☎️电话:010-82362290
扫码添加企业微信,发送【智能仿真】,获取报告PPT。
客服微信
