DynamicFusion
Newcombe 2015 · 論文
一行要約 — 非剛体的に変形するシーンに対する最初のリアルタイム密なSLAMシステムであり、固定された正規空間のTSDFモデルを各ライブフレームへ変換する密なボリューメトリック6D変形場を推定することで、すべてが動いている中でもKinectFusion式の融合を機能させる。
問題
KinectFusionおよびすべての伝統的な密なSLAMの背後にある最も基本的な仮定は、観測されるシーンが概ね静的であるということであり、変形する対象(人、手、衣服、ペット)はいずれもトラッキングを破壊し、モデルを破損させる。これまでの非剛体キャプチャは、取得中に静止したまま保持される事前スキャン済みのテンプレートを必要とするか、リアルタイムの3〜4桁遅いオフライン処理として実行されるかのいずれかであった。本論文の核心的な問いは、KinectFusionをどのように一般化すれば、単一の深度カメラからテンプレートフリーで、動的なシーンをリアルタイムに再構成し追跡できるか、である。
手法とアーキテクチャ
DynamicFusionは、シーンを剛体の正規空間(TSDF )で再構成された潜在的な幾何表面と、それをライブフレームへ変換するフレームごとのボリューメトリック変形場に分解する。新しい深度マップが来るたびに3つのステップが発生する: (1) 変形場の状態を推定する、(2) その変形場を通じてライブ深度を正規TSDFに融合する、(3) 新たに観測された幾何をカバーするよう変形場の構造を拡張する。
- 疎ノード+デュアルクォータニオン混合による密な6D変形場: 密な点ごとの変換(密なの場だとフレームあたり約1億パラメータが必要になる)は、個の変形ノード(位置、半径重み、6自由度変換)から補間される。正規空間の点は、そのk個の最近傍ノードのデュアルクォータニオン混合によって変形される。
単位デュアルクォータニオン、ガウス影響重みを用い、共通の剛体(カメラ)運動はとして因数分解される。DQBは混合された変換を有効な剛体運動のまま保つ。
- 非剛体投影TSDF融合: 各ボクセル中心はライブフレームへ変形され、そこで投影的符号付き距離が計算される: 、続いて標準的な切り捨てられた重み付き平均TSDF更新が行われる。融合重みは、ボクセルのk最近傍ノードへの平均距離に応じて縮小され、変形の不確実性を符号化する。更新はカメラ座標系における視線に沿って計算されるため、剛体TSDF融合の最適性の特性が非剛体の場合にも引き継がれる。
- 変形場推定: 深度と現在の再構成が与えられると、ノードの変換は以下を最小化する。
データ項は、変形されたゼロレベル集合のメッシュをライブフレームにレンダリングしてデータアソシエーションを行い、予測されたピクセルにわたるロバストなTukeyペナルティ付きの点対平面誤差を合計する: 。正則化項は、変形グラフのエッジにわたる不連続性を保持するHuberペナルティを備えた、極力剛体的(as-rigid-as-possible)な項である。
これは階層的な変形木の上に構築されるため、未観測の領域も区分的に滑らかに変形する。最適化は、ノードごとのツイストを用いたガウス・ニュートン法で行われる: まず密な剛体ICPがを解き、続いて2〜3回の非剛体反復が、そのアローヘッド型ヘシアンの疎なブロックコレスキー分解によって線形化系を解く。これらすべてはGPU上で、事前計算されたk最近傍ノードボリュームを用いて実行される。
- 変形場の拡張: 融合後、現在のノードによってサポートされていない表面頂点()は、少なくとも以上離れた新しいノードを生成する(デフォルトの間引き密度mm)。これらは現在の変形場からDQBによって初期化され、レベルの正則化階層(レベルごとに半径が倍に増加)が再構築される。実運用で使われたパラメータ: 、Tukey幅0.01、Huber幅0.0001。
実験結果
評価は定性的である(ベンチマーク表はない)。結果は、単一の深度カメラを使う実際のリアルタイムシステムから、市販ハードウェア上でライブに取得された。動くカメラで撮影された動く人物、60秒にわたる「カップから飲む」動作(最初のフレームでは見えていなかった表面も含む、腕とカップの完全なモデルが出現する)、そして手を組む「指を交差させる」全身シーケンス(手を組む間もモデルは一貫性を保つ)である。最初はノイジーで不完全なモデルが、対象とカメラの両方が動く中で徐々にノイズ除去され補完されていき、キャプチャ中にループ閉じ込みも発生する。記載されている限界: シーンが閉じたトポロジーから開いたトポロジーへ急速に移行する場合(閉じた手で開始した再構成はその手を開くことができない)、大きなフレーム間運動、そしてシーンの複雑さが増すにつれて成長するオクルージョン領域。CVPR 2015で発表され、Best Paper賞を受賞した。
SLAMにおける意義
DynamicFusionは、リアルタイム3D再構成とSLAM全体に浸透していた静的シーンの仮定を取り除き、ボリューメトリックTSDF融合を非剛体の場合に一般化し、密な6D変形場をフレームレートで推定できることを示した。その正規ボリューム+埋め込み変形グラフのレシピは、非剛体融合(VolumeDeform、KillingFusion、SurfelWarp)の雛形となり、現代の動的シーンSLAMシステムがカメラの動きとシーンの動きをどのように分離するかに影響を与えている。