Differentiability(微分可能性)

ニューラルネットワークを学習させるには、損失からパラメータへ勾配が流れる必要がある。しかし古典的SLAMは勾配を遮断する操作に満ちている:RANSACは離散的な仮説選択(argmax)を行い、特徴点検出は非最大値抑制とtop-kk選択を適用し、バンドル調整のような最適化ソルバーは閉形式の関数ではなく反復的な手続きである。Differentiability(微分可能性)の研究はこう問う:これらの古典的な幾何アルゴリズムをどのように微分可能にすれば、ネットワークをそれらを通して学習できるようになるのか——何らかの代理ラベルではなく、最終的な姿勢やマップの品質そのものを最適化できるのか。

なぜ古典的SLAMは勾配を遮断するのか

標準的なリローカライゼーションパイプラインを考える:ネットワークが2D-3D対応関係を予測し、RANSACが最小サンプル集合をサンプリングし、PnPが各仮説を解き、インライア数がそれらにスコアを付け、argmaxの仮説が勝つ。これらのステップのうち3つは非微分可能である:

チェーンのどこかのリンクが勾配を殺すと、それより上流の全てが(正解深度を模倣する、手ラベル付きマッチを模倣するといった)代理損失で学習されねばならず、それはシステムが本来すべきこととは一致しない可能性がある。

主な技術

各技術は代表的なシステムに結び付けられており、具体的に学ぶことができる:

その見返り:タスクレベル学習

この全ての仕組みの目的はタスクレベル学習である:正解深度や手ラベル付きマッチを模倣するようにネットワークを教えるのではなく、RANSAC/PnP/BAがその仕事を終えた後の最終的なカメラ姿勢が正確になるように学習する。学習目的とシステム目的が同じものになる。この整合性こそが、微分可能な幾何システム(DSACからACEへのリローカライゼーション系譜、DROID-SLAM)が、PoseNetのような素朴なエンドツーエンドの姿勢回帰よりも汎化する理由である——幾何は依然として厳密なソルバーによって強制され、ネットワークは学習によって利益を得る部分だけを学ぶ。

2番目の見返りは自己教師あり学習である:微分可能な投影とソルバーがあれば、既知のカメラ姿勢を通じた再投影損失が3Dの正解データを完全に置き換えられる——これはDSAC++が導入し、ACEファミリーが分単位のマッピングのために依拠しているトリックである。

よくある落とし穴

この文献における多くの工学的努力は、まさにこれらの問題を管理することに関するものである。

SLAMにおける意義

Differentiabilityは、レベル5の2つの半分を結ぶ橋である:それは学習型フロントエンドを幾何的バックエンドと組み合わせて学習可能にし、古典的最適化の厳密さを保ちながら周囲の全てを学習するハイブリッドシステムを生み出す。ソフト選択、ソルバーの展開、Lie群自動微分を理解することで、DSACからDROID-SLAMまでの論文を1つのアイデアの変奏として読めるようになる。

関連ノート