亚星百家乐科研｜0.4秒完成4D自驾高斯重建，性能提升50%！

来源：发布时间：2025-12-18

亚星百家乐青年教师赵昊课题组联合小米汽车等单位，推出了首个面向大型动态驾驶场景的无姿态（pose-free) 前馈三维重建框架——DGGT（Driving Gaussian Grounded Transformer）。该方法摆脱了传统依赖逐场景优化、相机标定以及短帧窗口的限制，能够直接从稀疏、无标定图像中重建长序列三维场景，使自动驾驶仿真迈向高速、可扩展的新阶段。

近年来，多模态大模型（MLLMs）发展迅猛，从看图说话到视频理解，似乎无所不能。但你是否想过：它们真的“看懂”并“想通”了吗？这些模型在面对复杂的、多步骤的视觉推理任务时，能否像人类一样推理和决策？

亚星百家乐执行院长刘洋教授团队，联合清华大学计算机系、复旦大学带来重磅新作——EscapeCraft：一个3D密室逃脱环境，让大模型像真人一样“动脑逃生”，用于评估多模态大模型在视觉环境中，完成复杂任务推理的能力。测评结果却意外频出：模型常常看到了门，却一直绕着墙走；捡起钥匙，却忘了怎么用；甚至有模型想去“抓”沙发，理由是“可能有暗格”……这不是个别翻车。而是系统性的“看见不代表理解”。即便是 GPT-4o 这样的明星模型，也只有少部分子任务是真的想明白了完成的，其它全是歪打正着。

•论文标题：DGGT: Feedforward 4D Reconstruction of Dynamic Driving Scenes using Unposed Images

•开源链接：//github.com/xiaomi-research/dggt

•项目主页：//xiaomi-research.github.io/dggt/

•论文作者：陈小雪，熊子轶，陈远韬，李根，王楠，罗鸿城，陈龙，孙海洋，王兵，陈光，叶航军，李弘扬，张亚勤，赵昊

DGGT 只需未标定的稀疏图像，单次前向即可同时输出相机位姿、深度、动态实例与基于 3D Gaussian 的可编辑场景表示。模型在 Waymo 上训练，却能在 nuScenes 与 Argoverse2 上实现强劲的零样本泛化——在关键感知指标上相比STORM提升超过 50%。此外，系统通过lifespan head建模场景随时间的外观演变，并配合单步扩散精修，有效抑制运动插值伪影，提升时空一致性与渲染自然度。

图1.左：从未标定稀疏图像在0.4 s内重建动态场景，并输出相机姿态、深度、动态图、3D Gaussian追踪等可编辑资产；右：在速度与精度上相较前向/优化方法处于更优位置

亮点速览

无需外参（Pose-Free） ：将相机位姿 从输入转为模型输出 ，端到端预测内外参并融入场景表示，打破跨数据集部署的校准壁垒。
Feed-forward 4D表示 ：采用多头联合预测结构（相机、4D Gaussian、 lifespan 、动态/运动、天空等），一次前向即可得到 时空一致 的可编辑表示。
跨数据集零样本泛化 ：仅在 Waymo 训练，无需在目标数据集上微调即可在 nuScenes 与 Argoverse2 上获得优于SOTA的定量与定性结果（LPIPS 降幅 52%–61%）。
可编辑性强 ：支持直接在 Gaussian 层面添加/删除/移动车辆、行人等实例，扩散精修自动补洞，输出可用于仿真与数据合成。
速度与质量兼顾 ：在Waymo上20 帧/视角，单场景约 0.39 s；PSNR 27.41 / SSIM 0.846，与优化类方法相比显著加速，与前向方法相比更高保真。

DGGT详解

DGGT 的核心思想是：一次前向就预测出“完整的4D场景状态”，并把相机位姿从前提变成结果。这使得系统无需外参标定即可从稀疏、未标定图像里恢复动态场景，而且能自然跨数据集部署。图1展示了DGGT 的整体能力与速度-精度位置：在0.4 秒量级完成重建的同时，DGGT 在重建质量上超越一系列前向与优化方法，并将相机姿态、深度、动态分割、3D Gaussian、追踪等输出一并给出，便于后续实例级场景编辑。

图2.DGGT 框架结构图 ViT 编码融合DINO先验，联合相机/高斯/寿命/动态/运动/天空六个预测头；渲染后接单步扩散精修，一次前向完成时空一致重建。

在系统结构上（图2），DGGT 采用 ViT 编码器融合 DINO 先验，通过交替注意力得到共享特征，再由多个预测头并行输出：

（1） 相机头 估计各帧内外参；
（2） Gaussian 头 给出逐像素 Gaussian 参数（颜色/位置/旋转/尺度/不透明度）；
（3） lifespan 头 用寿命参数调制时间维度可见性，精确刻画静态区域在不同时间的外观变化；
（4） 动态头+运动头 显式估计动态区域与 3D 运动轨迹，支持任意时间点的运动插值；
（5） 天空头 稳定建模远景背景。渲染后，再通过 单步扩散精修 抑制遮挡/插值产生的伪影与细节缺失。

表1. Waymo定量结果 DGGT无需相机位姿输入的同时，对场景中动静态进行判断，在Waymo数据集上获得更高PSNR/SSIM与更低深度误差，单场景推理仅约0.4s

表2. 其他消融实验和指标测试扩散模型虽然在性能上提升较小，但是生成的结果视觉效果更好，更适配于下游任务；同时DGGT在Waymo上EPE3D达0.183 m

在Waymo数据集上的定性与定量评估（见表1）表明：以往的前馈式静态重建方法（如 MVSplat、NoPoSplat、DepthSplat）在存在大范围运动目标的场景中难以维持时间一致性，且会产生明显的错配与伪影；而STORM虽然通过前馈式建模缓解了对逐场景优化的依赖，但在处理更长的时序跨度或更复杂的动态行为时仍可能出现性能退化。相比之下，DGGT能够在渲染级别上实现对静态与动态成分的有效分离，保持帧间外观与几何的一致性，从而显著提升整体视觉质量与重建稳定性。在定量指标上（表2），DGGT 在场景流估计上的EPE_3D为0.183 m，明显优于多种既有方法，证明了通过渲染监督学得的稠密三维对应具有良好的可靠性与精度。

表3. 零样本跨库泛化仅用Waymo训练，DGGT在nuScenes/Argoverse2上无需微调即显著优于STORM：LPIPS分别下降 61.4% 与 52.5%

跨数据集的零样本泛化能力是 DGGT 的另一项核心优势。模型仅在Waymo上训练，但在未做任何微调的情况下，在nuScenes与Argoverse2上均取得超越现有SOTA的结果（见表3）：如在nuScenes上 LPIPS从0.394 降至0.152（下降 61.4%）；在 Argoverse2上从0.326降至 0.155（下降52.5%）。这种跨域鲁棒性主要得益于DGGT 的pose-free 设计：将位姿从输入转为模型输出，减少了对固定拍摄轨迹与相机配置的依赖，从而降低了对特定数据采集设置的过拟合风险，使模型在不同传感器布置与行驶路径下仍能维持良好性能。

表4. 输入视角数消融当视角数从 4→8→16 增加时，DGGT的重建/NVS指标保持稳定；STORM出现明显下滑，DGGT更适合大规模日志处理

在可扩展性方面，DGGT 能自然支持任意数量的输入视角与长序列。从表4可以看到，当输入视角从 4 → 8 → 16 扩增时，DGGT 的重建与新视角插值（NVS）指标基本不变，而对比方法会明显下滑。这意味着 DGGT 不仅适合研究场景，更适合在大规模输入中做工程级预处理与批量重建，视角变多时不需要额外改模型或调参数。

图3. Lifespan head 价值去除lifespan后PSNR下降3.2 dB，静态区域的光照/反射时间变化难以刻画，时空一致性受损

Lifespan head 的作用在图3中的消融对比非常直接：去掉 lifespan 后，PSNR 从 27.41 降至 24.21，原因在于系统失去了对静态区域在时间维度上的细微变化（如亮度、反射、阴影过渡等）的建模能力。世界坐标静态的地方一旦无法随时间正确更新，就会破坏渲染的时空一致性与真实感，从而显著拉低最终画面质量。