DIFIX3D+

Wu 2025 · 论文

一句话总结 — 使用单步图像扩散模型(Difix)去除困扰NeRF/3DGS重建的浮游物、伪影几何和模糊,做法是在训练过程中将清理后的伪视图蒸馏回3D表示中,并在渲染时作为一个76毫秒的神经增强器使用。

问题

神经辐射场和3D高斯溅射已经革新了3D重建和新视角合成,但从极端新视角(远离已采集轨迹的视角)进行照片级真实渲染仍然充满挑战:只要3D模型欠约束,伪影就会在两种表示中持续出现。逐场景优化无法幻想出它从未观察到的可信内容,而在每个训练步骤都查询扩散模型的方法在扩展到大场景时表现很差。修复方案必须来自一个足够廉价、可以在重建过程中和之后都使用的学习式图像先验。

方法与架构

Difix,单步修复器。 SD-Turbo被微调(冻结VAE编码器,LoRA微调解码器,pix2pix-Turbo风格)为一个图像到图像的转换器,将退化的渲染视图 I~\tilde{I} 加上干净的参考视图 IrefI_{\text{ref}} 映射为精化视图 I^\hat{I}。关键洞察在于:由渲染伪影退化的图像,类似于扩散模型训练分布中中间噪声水平下的带噪图像,因此Difix在 τ=200\tau = 200 而非 τ=1000\tau = 1000 处运行单步去噪——这一设置经过实验验证是最优的。

参考混合层。 新视图和参考视图沿视图维度拼接并编码为潜变量 zRV×C×H×W\mathbf{z} \in \mathbb{R}^{V \times C \times H \times W};自注意力层作用于展平后的视图加空间维度,既继承了2D注意力权重,又捕获了跨视图线索(物体、颜色、纹理)。

损失函数。 L=LRecon+LLPIPS+0.5LGram\mathcal{L} = \mathcal{L}_{\text{Recon}} + \mathcal{L}_{\text{LPIPS}} + 0.5\,\mathcal{L}_{\text{Gram}},其中风格项是基于VGG-16特征 ϕl\phi_l 的Gram矩阵损失,用于鼓励清晰的细节:

LGram=1Ll=1LβlGl(I^)Gl(I)2,Gl(I)=ϕl(I)ϕl(I).\mathcal{L}_{\text{Gram}} = \frac{1}{L}\sum_{l=1}^{L} \beta_l \left\| G_l(\hat{I}) - G_l(I) \right\|_2, \qquad G_l(I) = \phi_l(I)^{\top}\phi_l(I) .

数据构建。 配对的伪影/干净训练数据通过以下方式人工构造:稀疏重建(每隔n帧训练一次)、循环重建(用在偏移1-6米的轨迹上训练的NeRF,重新渲染原始轨迹)、模型欠拟合(训练计划的25%-75%),以及跨相机参考。

Difix3D:渐进式3D更新。 从参考视图出发,每1500次迭代将训练相机位姿朝目标轨迹方向扰动,渲染得到的新视图经Difix清理后加入训练集——逐步增长面向极端视角的多视图一致3D线索。蒸馏保持结果的3D一致性,而避免逐步查询扩散模型使其比基于分数蒸馏(score-distillation)的方法快10倍以上。

Difix3D+:渲染时的精修。 由于Difix是单步的,它也可以作为对每一帧渲染结果的最终后处理环节运行——在NVIDIA A100上耗时76毫秒——去除蒸馏和有限模型容量遗留的残余伪影。同一个训练好的模型可同时服务于NeRF和3DGS两种骨干。

实验结果

对SLAM的意义

建立在辐射场或3D高斯之上的稠密SLAM系统(SplaTAM、MonoGS及其后继者)所产出的地图,在远离相机轨迹处渲染的新视图质量会迅速下降——这对AR预览、远程呈现和地图检视都是实际问题。DIFIX3D+表明,一个廉价的2D生成先验可以在不重新设计建图后端的情况下清理这些渲染结果,指向了一个通用模式:几何SLAM构建地图,而一个前馈式生成模型润色其输出——且速度快(单步)到足以置于渲染回路之内。

相关条目