微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 NVIDIA与多伦多大学联手:让3D虚拟物体真的会"软"——无需复杂网格的弹性形变模拟新突破

NVIDIA与多伦多大学联手:让3D虚拟物体真的会"软"——无需复杂网格的弹性形变模拟新突破

2026-06-08 13:46
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-08 13:46 科技行者

这项由NVIDIA与多伦多大学联合完成的研究发表于2026年5月,论文预印本编号为arXiv:2605.29318,有兴趣深入了解的读者可通过该编号查询完整论文。研究团队提出了一套名为"FreeForm"的全新弹性形变模拟方法,核心思想是用"粒子蒙皮特征模态"来驱动低自由度的物理仿真,使得各类三维物体——无论是传统网格模型还是最新的高斯点云表示——都能在不依赖高质量网格的前提下,快速、准确地模拟出真实的弹性形变行为。

如果你曾经玩过捏泥巴或者橡皮泥,你就大致理解这项研究想解决的问题。当你用手指按压一块橡皮泥时,它会凹陷、扩张、回弹,这一切都遵循物理规律。计算机图形学和机器人仿真领域的工程师们长期以来都希望让虚拟世界里的三维物体也能这样"活"起来——被机器人手臂推一把,就真的会弯曲变形;掉落在桌面上,就真的会轻微弹跳。然而,让计算机精确模拟这种物理行为,远比捏泥巴难得多。

传统上,完成这件事需要一张"网格"——就像给物体内部铺满了无数个小三角形或四面体,每一个小单元的形变都需要精确计算。这就好比你想知道一块海绵被压缩后每个气孔的变化,就必须先把每个气孔都建模出来。这种方法计算量极大,而且对输入模型的质量要求极高。更麻烦的是,当今流行的三维表示方法——比如"三维高斯点云"(3D Gaussian Splatting,简称3DGS),本质上只是一堆漂浮在空间中的半透明椭圆形小球,根本没有网格可言,传统方法对它们束手无策。

FreeForm的出现,就是要打破这一局面。研究团队的核心洞察是:与其花大力气建网格、算每一个细节,不如先找出这个物体"最自然的变形方式",然后只用少数几个关键参数来驱动整个仿真。这就像指挥一场交响乐——你不需要控制每位乐手的每一个手指动作,只要指挥好几个主要声部的节奏,整首曲子就能流畅演奏出来。

一、三维物体的物理仿真,为何如此棘手

要理解FreeForm解决的问题,得先弄清楚"弹性形变仿真"到底难在哪里。

一块真实的橡皮泥被压下去,它内部每一个微小区域都会发生位移、产生应力。计算机要模拟这个过程,最"笨"但最精确的办法就是有限元法(FEM)——把物体切成无数个小四面体,每个小四面体的变形都遵循弹性力学方程,然后把所有小四面体的行为加在一起,就得到了整体的形变结果。这种方法非常准确,被公认为弹性仿真的"黄金标准"。

然而,有限元法有两个根本性的麻烦。第一,它需要高质量的体积网格作为输入。给一个形状复杂的三维物体生成这样的网格,本身就是一项艰难的工程——就像要给一只章鱼的每条触手内部都填满整齐的四面体积木,稍有不规则就会导致计算失败。对于3DGS这样根本没有明确表面的表示方法,这个问题更是无从解决。第二,精度高意味着自由度多,自由度越多,每一步计算就越慢。高分辨率的有限元仿真往往需要几分钟甚至几小时才能完成一段几秒钟的动画,完全不适合实时应用。

于是,研究者们提出了各种替代方案。材料点法(MPM)和光滑粒子流体动力学(SPH)是其中最流行的两类"无网格"方法,它们把物体离散成一堆粒子,粒子之间通过核函数相互影响,不需要网格。这两种方法被广泛用于仿真3DGS物体,比如PhysGaussian和PhysDreamer这两个知名系统都采用了MPM。但粒子法也有自己的弱点:当物体被拉伸得很厉害时,粒子之间的距离会超过核函数的作用范围,仿真就会出现"数值断裂"——明明是一块完整的橡皮泥,计算机却认为它裂开了。而且粒子法对时间步长和空间分辨率都非常敏感,参数选不好就会计算爆炸。

另一条路是"降阶仿真"(reduced-order simulation)。这个思路的核心是:既然物体在现实中的变形方式是有规律的,那能不能提前学好这些规律,然后仿真时只用少数几个"旋钮"来控制整体变形?这就像给物体的变形方式做了一个高度压缩的描述——原来需要一万个数才能描述清楚的变形,现在用三十二个数就够了,计算速度自然快得多。

降阶仿真中最关键的概念是"蒙皮权重"(skinning weights)。你可以把它理解成一套"遥控规则":物体被分成几个区域,每个区域由一个"控制点"负责。当你移动控制点时,周围的区域就跟着变形,距离控制点越近,变形越大,越远越小。这就像皮影戏——几根细线控制着整个皮影的所有动作,你只需要拉动几根线,就能让皮影做出各种姿势,而不需要单独控制皮影的每一个部位。

在降阶仿真领域,最近有一个重要工作叫做Simplicits,它的思路是用神经网络来学习蒙皮权重。给定任意一个三维物体,Simplicits先训练一个小型神经网络,让这个网络学会如何把空间中的任意一点映射到一组权重数值,然后用这些权重来驱动仿真。Simplicits不需要网格,只需要能判断一个点在不在物体内部即可,因此理论上适用于各种三维表示。但它也有两个明显的缺陷:每个新物体都要重新训练网络,训练过程耗时不短(平均约两分钟);而且训练是基于随机采样变形来最小化弹性能量,这种优化方式容易陷入局部最优,导致仿真精度不够高。

FreeForm的目标,就是同时解决速度和精度这两个问题。

二、RKPM:给粒子加一套更聪明的"影响规则"

FreeForm的第一个关键工具是"再生核粒子法"(Reproducing Kernel Particle Method,简称RKPM)。这个名字听起来很专业,但背后的直觉其实很简单。

回到皮影戏的比喻。普通的粒子法就像最原始的皮影控制方式:每根线只影响它直接绑定的那个部位,线和线之间完全独立。这样的控制方式很简单,但效果粗糙,皮影的动作会显得生硬不连续。更聪明的做法是让每根线的影响以一种平滑的方式"扩散"到周围,而且这种扩散方式要满足某种数学上的"再生性"——确保多根线的影响加在一起时,能够精确重现一些基本的运动模式,比如整体平移和旋转。

具体来说,RKPM在普通径向基函数(RBF,一种常见的平滑插值方法)的基础上加入了"修正项"。普通的RBF就像一堆圆形的影响泡泡,每个粒子控制自己泡泡内的区域,泡泡边缘的影响随距离增加而衰减。但这种简单的泡泡叠加方式有个问题:如果你想让整个物体做一个纯粹的平移运动,理论上所有点的位移应该完全相同,但普通RBF的加权方式未必能保证这一点,尤其在粒子分布不均匀时会出现误差。RKPM通过引入一个修正函数C(X),使得核函数满足"再生条件"——即多项式函数(包括常数和线性函数)能被这套核函数精确重现。

研究团队通过一个直观的对比实验展示了这一点:在同一套粒子分布上,普通RBF和带有归一化的RBF(partition-of-unity RBF)计算出的第一个非零拉普拉斯特征模态(可以理解为最基本的弯曲方式)形状参差不齐、凹凸不平;而RKPM计算出的特征模态则近乎完美地呈现出平滑的线性场,与理论预期完全吻合。这个差异至关重要——蒙皮权重的质量直接决定了仿真的精度。

三、弹性特征模态:找到物体"最自然的变形方式"

找到了RKPM这个好用的工具之后,FreeForm的第二个关键步骤是"特征模态分析"(eigenmode analysis)。这一步的目标,是找出物体在弹性约束下"最自然、最高效"的一组变形方式,用它们来构建蒙皮权重。

可以用音叉来理解这个概念。当你敲击一把吉他时,琴弦会振动,但它不会以任意随机的方式振动,而是以一系列固定的模式振动——最基本的模式是整根弦同向摆动,然后是弦分成两半相向摆动,再是三等分,以此类推。这些固定的振动模式就叫做"特征模态"或"本征模态"。对于弦来说,第一个特征模态需要最少的能量就能激发,第二个需要稍多,以此类推。

弹性固体的变形方式也有类似的特征模态。一根细长的橡皮棒,最自然的弯曲方式是整体弯成一个弧形(第一模态),其次是弯成S形(第二模态),再是W形(第三模态)。这些模态不是人为规定的,而是由物体的形状和材料属性共同决定的——需要最少弹性能量的那些变形方式,自然就是物体"最愿意"发生的形变。

FreeForm的做法是:用RKPM把弹性势能的黑塞矩阵(Hessian matrix,可以理解为描述能量弯曲程度的数学对象)显式地算出来,然后对这个矩阵做广义特征值分解,取出前m个对应最小特征值的特征向量,把它们作为蒙皮权重的节点值。这m个特征向量,就是这个物体在弹性意义下最"省力"、最"自然"的m种变形模式。

研究团队还推导出了一个简洁的数学表达式,专门用于计算Neo-Hookean弹性能量(一种常用的超弹性材料模型,能模拟橡胶、软组织等的大变形行为)的黑塞矩阵。结论是:权重空间黑塞矩阵H_w的第(i,j)个元素,等于材料系数(λ+4μ)乘以两个RKPM基函数梯度的内积在整个体积上的积分。对于材料均匀的情况,这个系数可以提到积分外面,黑塞矩阵就直接正比于RKPM的弱形式拉普拉斯矩阵——这意味着在均匀材料下,弹性特征模态就是拉普拉斯特征模态,与经典模态分析中的概念完美统一。对于材料不均匀的情况,FreeForm的方法可以被理解为一种"材料感知的拉普拉斯特征模态",能够自动在刚度分布中找到最合适的变形模式。

这一推导的重要性在于:整个黑塞矩阵的计算完全是解析的、显式的,不需要任何迭代优化,只需要一次矩阵组装加一次特征值分解,就能得到高质量的蒙皮权重。这与Simplicits需要训练神经网络形成了鲜明对比。

四、从权重到仿真:低自由度的弹性时间步进

有了蒙皮权重,仿真阶段就相对直接了。FreeForm沿用了蒙皮变形的经典框架,用"线性混合蒙皮"(Linear Blend Skinning,LBS)描述物体的变形:物体上每一个点的新位置,等于原始位置加上所有m个控制变换的加权叠加,权重就是之前计算出的蒙皮函数在该点的取值。

每一个时间步,仿真器需要求解一个"增量势能最小化"问题——找到使得惯性能量、弹性势能和外力势能之和最小的那组仿真自由度。这个问题用牛顿法迭代求解,每次迭代需要计算梯度和黑塞矩阵(在仿真阶段是针对仿真自由度的,不同于训练阶段的权重空间黑塞矩阵)。由于自由度从成千上万个顶点压缩到了只有m个仿真参数(m通常取6到32),每一步的线性系统规模极小,求解速度极快。

整个仿真流程完全基于拉格朗日描述(即跟踪物质点的运动,而非欧拉描述的网格固定),形函数在整个仿真过程中保持不变,可以使用完全隐式的时间积分,时间步长不受CFL条件(一种数值稳定性约束)的限制,这是相对于MPM和SPH的又一项优势。

五、实验验证:从标准梁测试到真实三维场景

研究团队进行了系统全面的实验,从经典力学基准测试到复杂三维场景都有覆盖。

最基础的测试是"悬臂梁"实验——一根5米×1米×1米的长方体梁,一端固定,另一端自由,观察它在重力下弯曲和在扭矩下旋转的行为,并以有限元法的结果作为"标准答案"。在弯曲测试中,当使用32个仿真变换时,FreeForm的归一化均方误差(MSE)达到2.93e-06,而Simplicits在相同条件下为1.17e-04,FreeForm的精度比Simplicits高出约四十倍。在扭转720度的极端测试中,FreeForm(32个变换)的MSE为6.64e-06,Simplicits为4.21e-05,仍然有约六倍的精度优势。视觉对比也非常直观:FEM的半透明参考结果叠加在各方法结果上,FreeForm的变形轮廓与FEM几乎完全重合,而Simplicits则有明显的偏差。

更重要的是,随着仿真变换数量从6个增加到32个,FreeForm的精度持续提升,并在较多变换时能够接近甚至超过MPM和SPH这两种全自由度方法的精度——而FreeForm使用的自由度只有MPM和SPH的极小一部分。

为了验证方法在多样化物体上的泛化性,研究团队从Thingi10K数据集(一个包含各类三维打印模型的在线数据库)和Simready数据集(由艺术家创作的真实物体网格)中分别选取了20和19个形状,针对三种边界条件(固定一侧、向四个最远点拉伸、沿最长轴两端拉伸)分别进行了仿真评估。对于Thingi10K,研究团队根据物体的语义类别手动分配了杨氏模量(有机体类约10^5帕,其他类约10^8帕),而对于Simready,他们使用了另一个工具VoMP预测出每个物体的体积物理参数(包括杨氏模量、泊松比和密度),并用同样的参数运行FEM作为参考。

在这个大规模评估中,FreeForm在所有三种边界条件下的MSE和最大误差都比Simplicits低约20%到40%,而训练时间从Simplicits的平均约120秒骤降到约3.5秒,实现了大约40倍的加速。这个加速来自于FreeForm的本质优势:计算一次矩阵并做特征值分解,远比训练一个神经网络快得多,而且结果的正交性是精确满足的(数值误差级别),而Simplicits只能通过损失函数中的软约束项近似保证正交性。

研究团队还额外计算了一个"基底拟合残差"指标——把FEM的仿真轨迹投影到各方法给出的蒙皮基底上,看最优拟合的误差是多少。这个指标衡量的是蒙皮权重的"表达能力",而不受动力学积分误差的影响。结果同样显示FreeForm的基底能更好地解释FEM的仿真结果,进一步证明了特征模态方法在构建物理相关蒙皮基底上的优越性。

研究团队还测试了一个更有挑战性的异质材料案例:一个由四层交替刚软材料(杨氏模量分别为10^7和10^4帕,相差一千倍)构成的球体被丢到地面上。FreeForm能够捕捉到软层的大幅压缩和刚层相对较小的变形,呈现出明显的分层动力学行为;而Simplicits只能给出整体刚性的全局变形,完全看不出层与层之间的差异。这正体现了材料感知特征模态的优势——它的黑塞矩阵在每个积分点都包含了该点的材料参数,自然地把刚软差异编码到了基底里。

六、消融实验:每个设计选择都有其必要性

为了验证各个设计决策的合理性,研究团队做了详细的消融实验,系统比较了不同训练策略的效果。

第一个比较是损失函数:用Simplicits的"随机变换期望弹性能量"还是FreeForm的"黑塞矩阵近似"?在同样使用RKPM参数化的前提下,黑塞矩阵方式的精度明显更高,原因在于弹性能量的期望值最小化本质上是对所有可能变形的全局平均,而黑塞矩阵方法直接针对的是小变形时最需要优化的能量方向,物理针对性更强。

第二个比较是积分点采样:每次迭代随机采样(如Simplicits)还是固定均匀网格采样(如FreeForm)?结果显示,固定均匀网格采样的精度更高,因为均匀分布能更准确地近似体积积分,而随机采样在有限次迭代内会有统计噪声。

第三个最关键的比较是同样用黑塞矩阵加均匀采样,但用梯度优化求解(类似Simplicits的框架)与直接求解广义特征值问题。这两种方式的精度几乎相同,但特征值求解法的训练时间仅约4秒,而梯度优化法约需146秒——快了接近40倍,而且特征值分解给出的权重满足精确正交性,有利于仿真阶段牛顿法的数值条件。

此外,研究团队也验证了在仿真阶段,FreeForm的结果对积分点采样方式(均匀网格vs随机均匀)的敏感度与Simplicits相当,两者都会因采样方式不同而有所波动,但FreeForm在两种采样策略下都保持了更低的绝对误差。

七、应用展示:高斯点云、大规模场景与机器人仿真

除了定量评估,研究团队还展示了FreeForm在多种实际场景中的定性效果。

在三维高斯点云(3DGS)物体仿真方面,研究团队展示了多个扫描自真实物体的3DGS模型——包括玩具、食物、装饰品等——在FreeForm驱动下的弹性形变动画,物体的外观细节(由高斯点云决定)与物理行为(由FreeForm决定)协调一致,视觉效果自然真实。

在大规模场景方面,研究团队演示了13个不同的3DGS物体同时被丢进一个容器的互动仿真,以及18个高斯点云狗玩具通过弹珠机(plinko machine)落下的过程。这类包含多个物体互动的场景对仿真系统的鲁棒性和效率提出了很高要求,FreeForm在保持实时性的同时完成了这些复杂场景的仿真。

在机器人仿真方面,研究团队展示了机械臂与多个3DGS物体发生接触和交互的仿真过程,这对物理AI领域的训练数据生成和机器人操作规划有直接的应用价值。

值得一提的是,研究团队还展示了如何利用FreeForm计算柯西应力张量并可视化应力分布。通过将第一皮奥拉-基尔霍夫应力张量转换为变形构型下的柯西应力张量,可以清晰地看到扭转梁内部的三个主应力分量的空间分布,为结构力学分析提供了直观工具。

八、局限性与未来方向

FreeForm是一个很有价值的进步,但研究团队也诚实地指出了它的局限性。

作为降阶模型的共同局限,FreeForm难以表现高频的局部细节(如布料上的细小皱褶),因为全局蒙皮基底本质上是平滑的低频变形模式。遇到尖锐接触或大幅非线性效应时,基于线性化黑塞矩阵推导的基底也会遇到挑战,因为这个基底是在静止位置附近线性展开的,对大变形的表达能力有限。默认情况下FreeForm也不支持拓扑变化(如断裂),这是大多数降阶方法的共同局限。

RKPM自身也带来了一些特殊要求:核半径、采样密度和粒子分布都需要仔细调整才能保证基底质量;对于没有明确内外判断的表示(如3DGS),直接用高斯点作为积分点可能引入一定误差;系统对这些参数的敏感性高于神经网络方法(后者在一定程度上对采样策略更鲁棒)。

这些局限性也指向了未来的研究方向:将降阶基底与接触处理的精细化方法相结合;探索能够捕捉高频细节的层次化基底;以及进一步提升对各类三维表示的适应能力。

归根结底,FreeForm做的事情是这样的:它找到了一把更聪明的"遥控器",用数学上最优的几个旋钮,就能驱动三维物体做出符合物理规律的变形动作。这把遥控器不需要花两分钟学习(Simplicits要这么久),而是几秒钟就能设计好;它驱动出来的动作不仅看着对,而且和精确的有限元法对比,误差也更小。对于机器人训练、游戏物理、虚拟现实内容制作来说,这意味着更快的流程、更高的质量,以及对各种新型三维表示方式的原生支持。

---

Q&A

Q1:FreeForm和有限元法(FEM)相比,哪个更准确?

A:有限元法是弹性仿真的"黄金标准",精度最高,FreeForm以FEM结果作为参考基准来评估自己。在低自由度(如6-9个变换)时,FreeForm的精度不及FEM;但当变换数量增加到32个时,FreeForm的误差可以接近甚至优于MPM、SPH这类全自由度方法,同时运行速度远快于FEM。

Q2:FreeForm能用于没有网格的3D高斯点云(3DGS)物体仿真吗?

A:可以。FreeForm只需要能在物体体积内采样积分点,对于有明确内外判断的网格模型,会先过滤掉外部点;对于3DGS这类没有明确表面的表示,可以直接将高斯点本身作为积分点使用(必要时降采样以避免内存溢出),因此天然支持3DGS物体的弹性仿真。

Q3:FreeForm的训练阶段需要多长时间,比Simplicits快在哪里?

A:FreeForm的训练阶段(构建RKPM核函数、组装黑塞矩阵和质量矩阵、做广义特征值分解)平均约3到4秒,而Simplicits需要约120秒。快的根本原因是FreeForm用解析方法直接求解一个广义特征值问题,不需要反复迭代优化神经网络,因此大约快了40倍,同时权重的正交性也能精确满足。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-