DIFIX3D+
Wu 2025 · 論文
一行要約 — 単一ステップの画像拡散モデル(Difix)を使用して、NeRF/3DGS再構成を悩ませるフローター、偽の幾何、ぼやけを除去する。学習中にクリーンな疑似ビューを3D表現に蒸留し直すことと、レンダリング時に76msのニューラル強調器として動作させることの両方によって実現する。
問題
Neural Radiance FieldsとGaussian Splattingは3D再構成と新規視点合成に革命を起こしたが、極端な新規視点——撮影された軌道から遠く離れた視点——からのフォトリアリスティックなレンダリングは依然として難しい:3Dモデルが不十分にしか制約されていない場所ではどこでも、両方の表現にアーティファクトが残る。シーンごとの最適化は、一度も観測していないもっともらしいコンテンツを幻覚することはできず、学習の各ステップで拡散モデルに問い合わせる手法は大規模シーンにうまくスケールしない。この修正は、再構成の内部と後の両方で使うのに十分安価な学習型画像事前分布から来る必要がある。
手法とアーキテクチャ
Difix、単一ステップの修正器。 SD-Turboをファインチューンし(VAEエンコーダは固定、デコーダはLoRAでファインチューン、pix2pix-Turbo風)、劣化したレンダリングビューとクリーンな参照ビューを精緻化されたビューにマッピングする画像対画像変換器にする。鍵となる洞察:レンダリングアーティファクトによって劣化した画像は、拡散モデルのノイズの多い学習分布の中間ノイズレベルに似ている。そのためDifixはではなくで単一ステップのデノイズを行う——実験的に最良の設定であると検証されている。
参照混合層。 新規ビューと参照ビューはビュー軸に沿って連結され、潜在表現にエンコードされる;自己注意層は、フラット化されたビュー+空間次元にわたって適用され、2D注意重みを継承しながらクロスビューの手がかり(物体、色、テクスチャ)を捉える。
損失関数。 、ここでスタイル項はVGG-16特徴上のGram行列損失で、鋭いディテールを促す:
データキュレーション。 ペアになったアーティファクト付き/クリーンな学習データは、疎な再構成(n番目ごとのフレームで学習)、サイクル再構成(1~6m移動した軌道で学習されたNeRFから元の軌道を再レンダリング)、モデルのアンダーフィッティング(学習スケジュールの25~75%)、クロスカメラ参照によって人工的に作られる。
Difix3D:段階的な3D更新。 参照ビューから始めて、1500イテレーションごとに学習用カメラ姿勢が目標軌道に向かって摂動され、結果として得られる新規ビューがレンダリングされ、Difixによってクリーン化され、学習セットに追加される——極端な視点に向けて、多視点で一貫した3Dの手がかりを段階的に増やしていく。蒸留により結果は3D一貫性を保ち、ステップごとの拡散問い合わせを避けることでスコア蒸留系のアプローチより10倍以上高速になる。
Difix3D+:レンダリング時の仕上げ。 Difixは単一ステップであるため、レンダリングされた各フレームに対する最終的な後処理パスとしても動作する——NVIDIA A100で76ms——蒸留とモデル容量の限界が残す残存アーティファクトを除去する。同じ学習済みモデルがNeRFと3DGSの両バックボーンに使える。
実験結果
- Nerfbustersデータセット:Difix3D+(Nerfacto)はPSNR 18.32 / LPIPS 0.2789 / FID 49.44に達する、対してNerfactoベースラインは17.29 / 0.4021 / 134.65;Difix3D+(3DGS)は18.51 / 0.2637 / 41.77、対して3DGSは17.66 / 0.3265 / 113.84——LPIPSはおよそ0.1低く、FIDは約3倍低く、PSNRは約1dB高く、全ての指標でNerfbusters、GANeRF、NeRFLiXを上回る。
- DL3DVベンチマーク:FID 112.30 → 41.77(Nerfacto)、107.23 → 40.86(3DGS)。
- RDS自動運転データセット(中央カメラで学習、側方カメラで評価):PSNR 19.95 → 21.75、FID 91.38 → 73.08、NeRFLiXを上回る。
- アブレーション:3D更新なしの素朴なフレームごとの修正はちらつきを起こす;段階的更新なしの非漸進的な蒸留はLPIPS/FIDを劣化させる;からへノイズを下げるだけでLPIPSとFIDが著しく改善する。総じて論文はベースラインに対して平均2倍のFID改善を、3D一貫性を維持しながら報告している。
SLAMにおける意義
放射輝度場や3Dガウシアン上に構築された密なSLAMシステム(SplaTAM、MonoGS、およびその後継)は、カメラ軌道から離れるにつれて急速に劣化するレンダリングされた新規視点を持つマップを生成する——これはAR用プレビュー、テレプレゼンス、マップ検査にとって現実的な問題である。DIFIX3D+は、安価な2D生成事前分布がマッピングのバックエンドを再設計せずにこれらのレンダリングをクリーンアップできることを示し、より一般的なパターンを指し示す:幾何的SLAMがマップを構築し、フィードフォワードの生成モデルがその出力を仕上げる——レンダリングループに入れられるほど高速(単一ステップ)である。