DIFIX3D+
Wu 2025 · 论文
一句话总结 — 使用单步图像扩散模型(Difix)去除困扰NeRF/3DGS重建的浮游物、伪影几何和模糊,做法是在训练过程中将清理后的伪视图蒸馏回3D表示中,并在渲染时作为一个76毫秒的神经增强器使用。
问题
神经辐射场和3D高斯溅射已经革新了3D重建和新视角合成,但从极端新视角(远离已采集轨迹的视角)进行照片级真实渲染仍然充满挑战:只要3D模型欠约束,伪影就会在两种表示中持续出现。逐场景优化无法幻想出它从未观察到的可信内容,而在每个训练步骤都查询扩散模型的方法在扩展到大场景时表现很差。修复方案必须来自一个足够廉价、可以在重建过程中和之后都使用的学习式图像先验。
方法与架构
Difix,单步修复器。 SD-Turbo被微调(冻结VAE编码器,LoRA微调解码器,pix2pix-Turbo风格)为一个图像到图像的转换器,将退化的渲染视图 加上干净的参考视图 映射为精化视图 。关键洞察在于:由渲染伪影退化的图像,类似于扩散模型训练分布中中间噪声水平下的带噪图像,因此Difix在 而非 处运行单步去噪——这一设置经过实验验证是最优的。
参考混合层。 新视图和参考视图沿视图维度拼接并编码为潜变量 ;自注意力层作用于展平后的视图加空间维度,既继承了2D注意力权重,又捕获了跨视图线索(物体、颜色、纹理)。
损失函数。 ,其中风格项是基于VGG-16特征 的Gram矩阵损失,用于鼓励清晰的细节:
数据构建。 配对的伪影/干净训练数据通过以下方式人工构造:稀疏重建(每隔n帧训练一次)、循环重建(用在偏移1-6米的轨迹上训练的NeRF,重新渲染原始轨迹)、模型欠拟合(训练计划的25%-75%),以及跨相机参考。
Difix3D:渐进式3D更新。 从参考视图出发,每1500次迭代将训练相机位姿朝目标轨迹方向扰动,渲染得到的新视图经Difix清理后加入训练集——逐步增长面向极端视角的多视图一致3D线索。蒸馏保持结果的3D一致性,而避免逐步查询扩散模型使其比基于分数蒸馏(score-distillation)的方法快10倍以上。
Difix3D+:渲染时的精修。 由于Difix是单步的,它也可以作为对每一帧渲染结果的最终后处理环节运行——在NVIDIA A100上耗时76毫秒——去除蒸馏和有限模型容量遗留的残余伪影。同一个训练好的模型可同时服务于NeRF和3DGS两种骨干。
实验结果
- Nerfbusters数据集:Difix3D+(Nerfacto)达到PSNR 18.32/LPIPS 0.2789/FID 49.44,对比Nerfacto基线的17.29/0.4021/134.65;Difix3D+(3DGS)达到18.51/0.2637/41.77,对比3DGS的17.66/0.3265/113.84——LPIPS低约0.1,FID低约3倍,PSNR高约1 dB,且在每项指标上都优于Nerfbusters、GANeRF和NeRFLiX。
- DL3DV基准:FID从112.30降到41.77(Nerfacto),从107.23降到40.86(3DGS)。
- RDS自动驾驶数据集(中央相机用于训练,侧方相机用于评测):PSNR从19.95提升到21.75,FID从91.38降到73.08,超过NeRFLiX。
- 消融实验:朴素的逐帧修复而不做3D更新会出现闪烁;非增量式蒸馏在LPIPS/FID上比渐进式更新更差;仅将噪声从 降到 就能显著改善LPIPS和FID。总体而言,论文报告相对基线平均提升了2倍的FID,同时保持了3D一致性。
对SLAM的意义
建立在辐射场或3D高斯之上的稠密SLAM系统(SplaTAM、MonoGS及其后继者)所产出的地图,在远离相机轨迹处渲染的新视图质量会迅速下降——这对AR预览、远程呈现和地图检视都是实际问题。DIFIX3D+表明,一个廉价的2D生成先验可以在不重新设计建图后端的情况下清理这些渲染结果,指向了一个通用模式:几何SLAM构建地图,而一个前馈式生成模型润色其输出——且速度快(单步)到足以置于渲染回路之内。