DIFIX3D+

Wu 2025 · 論文

一行要約 — 単一ステップの画像拡散モデル(Difix)を使用して、NeRF/3DGS再構成を悩ませるフローター、偽の幾何、ぼやけを除去する。学習中にクリーンな疑似ビューを3D表現に蒸留し直すことと、レンダリング時に76msのニューラル強調器として動作させることの両方によって実現する。

問題

Neural Radiance FieldsとGaussian Splattingは3D再構成と新規視点合成に革命を起こしたが、極端な新規視点——撮影された軌道から遠く離れた視点——からのフォトリアリスティックなレンダリングは依然として難しい:3Dモデルが不十分にしか制約されていない場所ではどこでも、両方の表現にアーティファクトが残る。シーンごとの最適化は、一度も観測していないもっともらしいコンテンツを幻覚することはできず、学習の各ステップで拡散モデルに問い合わせる手法は大規模シーンにうまくスケールしない。この修正は、再構成の内部と後の両方で使うのに十分安価な学習型画像事前分布から来る必要がある。

手法とアーキテクチャ

Difix、単一ステップの修正器。 SD-Turboをファインチューンし(VAEエンコーダは固定、デコーダはLoRAでファインチューン、pix2pix-Turbo風)、劣化したレンダリングビューI~\tilde{I}とクリーンな参照ビューIrefI_{\text{ref}}を精緻化されたビューI^\hat{I}にマッピングする画像対画像変換器にする。鍵となる洞察:レンダリングアーティファクトによって劣化した画像は、拡散モデルのノイズの多い学習分布の中間ノイズレベルに似ている。そのためDifixはτ=1000\tau = 1000ではなくτ=200\tau = 200で単一ステップのデノイズを行う——実験的に最良の設定であると検証されている。

参照混合層。 新規ビューと参照ビューはビュー軸に沿って連結され、潜在表現zRV×C×H×W\mathbf{z} \in \mathbb{R}^{V \times C \times H \times W}にエンコードされる;自己注意層は、フラット化されたビュー+空間次元にわたって適用され、2D注意重みを継承しながらクロスビューの手がかり(物体、色、テクスチャ)を捉える。

損失関数。 L=LRecon+LLPIPS+0.5LGram\mathcal{L} = \mathcal{L}_{\text{Recon}} + \mathcal{L}_{\text{LPIPS}} + 0.5\,\mathcal{L}_{\text{Gram}}、ここでスタイル項はVGG-16特徴ϕl\phi_l上のGram行列損失で、鋭いディテールを促す:

LGram=1Ll=1LβlGl(I^)Gl(I)2,Gl(I)=ϕl(I)ϕl(I).\mathcal{L}_{\text{Gram}} = \frac{1}{L}\sum_{l=1}^{L} \beta_l \left\| G_l(\hat{I}) - G_l(I) \right\|_2, \qquad G_l(I) = \phi_l(I)^{\top}\phi_l(I) .

データキュレーション。 ペアになったアーティファクト付き/クリーンな学習データは、疎な再構成(n番目ごとのフレームで学習)、サイクル再構成(1~6m移動した軌道で学習されたNeRFから元の軌道を再レンダリング)、モデルのアンダーフィッティング(学習スケジュールの25~75%)、クロスカメラ参照によって人工的に作られる。

Difix3D:段階的な3D更新。 参照ビューから始めて、1500イテレーションごとに学習用カメラ姿勢が目標軌道に向かって摂動され、結果として得られる新規ビューがレンダリングされ、Difixによってクリーン化され、学習セットに追加される——極端な視点に向けて、多視点で一貫した3Dの手がかりを段階的に増やしていく。蒸留により結果は3D一貫性を保ち、ステップごとの拡散問い合わせを避けることでスコア蒸留系のアプローチより10倍以上高速になる。

Difix3D+:レンダリング時の仕上げ。 Difixは単一ステップであるため、レンダリングされた各フレームに対する最終的な後処理パスとしても動作する——NVIDIA A100で76ms——蒸留とモデル容量の限界が残す残存アーティファクトを除去する。同じ学習済みモデルがNeRFと3DGSの両バックボーンに使える。

実験結果

SLAMにおける意義

放射輝度場や3Dガウシアン上に構築された密なSLAMシステム(SplaTAM、MonoGS、およびその後継)は、カメラ軌道から離れるにつれて急速に劣化するレンダリングされた新規視点を持つマップを生成する——これはAR用プレビュー、テレプレゼンス、マップ検査にとって現実的な問題である。DIFIX3D+は、安価な2D生成事前分布がマッピングのバックエンドを再設計せずにこれらのレンダリングをクリーンアップできることを示し、より一般的なパターンを指し示す:幾何的SLAMがマップを構築し、フィードフォワードの生成モデルがその出力を仕上げる——レンダリングループに入れられるほど高速(単一ステップ)である。

関連ノート