Neural Ray Surfaces
Vasiljevic 2020 · 論文
一行要約 — 自己教師あり深度・自己運動学習における固定ピンホール投影を、学習されたピクセル単位のレイサーフェスに置き換えることで、同じフォトメトリック学習フレームワークを、キャリブレーション不要のまま魚眼レンズ・カタディオプトリックカメラ、さらには水中カメラにも適用できるようにする。
問題
自己教師あり学習は深度と自己運動の推定における強力な手法となったが、この系列の手法にはすべて共通の重大な隠れた限界がある:ビュー合成のステップは既知のパラメトリックなカメラモデル——ほぼ常に標準的なピンホール幾何——を仮定している。そのため、この仮定から大きく外れる撮像システム(カタディオプトリックカメラ、水中撮像、湾曲したフロントガラス越しのカメラ)ではこの手法は完全に失敗する。パラメトリックな歪みモデルは近似的にしか正しくなく、カメラの種類ごとに新しい微分可能な投影モデルが必要であり、いくつかの設定ではそもそも存在しない。ピンホール内部パラメータを学習する手法(Gordon 2019)でさえ、これらのケースには対応できない。
手法とアーキテクチャ
標準的な自己教師あり設定(Zhouらの手法)はそのまま維持される:深度ネットワーク 、対象フレームとコンテキストフレーム間の を予測する姿勢ネットワーク 、そしてフォトメトリックワープ
が用いられ、(コンテキストフレームにわたるピクセル単位最小値およびauto-maskingを伴うSSIM+L1見え方損失、加えてエッジ考慮の平滑化損失)で学習する。変更されるのは非投影 と投影 である。Grossberg & Nayarの一般カメラモデルに従い、各ピクセルは単位視線ベクトルを持つ:深度ネットワークのエンコーダを共有する2番目のデコーダがレイサーフェス を予測する。
非投影はクローズドフォームである——カメラ中心 (中心射影カメラの場合は原点に設定)から視線を深度でスケールする:
投影にはクローズドフォームがない:3D点 は、方向 に最もよく整合する視線を持つコンテキスト画像内のピクセルとマッチさせる必要がある:
これは であり、かつ非微分可能である。これを学習可能にする3つの工夫がある:(1) ソフトマックス対応付け——類似度テンソル に対するargmaxを、温度 のソフトマックス に置き換え、 をone-hotに向けて焼きなまし、その後ピクセル索引を読み出して空間変換ネットワークでサンプリングする;(2) 残差レイサーフェステンプレート——固定テンプレート (キャリブレーションが存在しない場合、ダミー内部パラメータ 、 によるピンホールサーフェス)の周りで を学習し、 を10エポックにわたって0から1に漸増させる——このピンホール事前知識は、カタディオプトリックデータに対してさえ学習を安定化させる;(3) パッチベースの対応付け——学習中は、半解像度における対象ピクセル周辺の グリッドに探索を限定する。テスト時には近似は不要であり、フル解像度のレイサーフェスがネットワークから直接得られる。
実験結果
- KITTI(ほぼピンホールなデータでの健全性チェック、80mまでの距離):完全に学習されたレイサーフェス(RS-L)を用いるNRS-ResNetはAbs Rel 0.134 / RMSE 5.263に達し、Gordonらの学習済みピンホール手法の0.128 / 5.230に匹敵する;NRS-PackNetはAbs Rel 0.127 / Sq Rel 0.667 / RMSE 4.049に改善する。学習されたサーフェスはフレーム間で安定している(テストセット全体で変動係数2.5%未満)。
- Multi-FOV(合成魚眼):ピンホールモデルではAbs Rel 0.441だが、NRSでは0.225に低下——51%の減少( 0.336→0.593)。
- OmniCam(カタディオプトリック、360°視野角):カタディオプトリック映像でオドメトリを学習した初の自己教師あり単眼手法——ATEはピンホール投影を用いた同じフレームワークの0.408(発散する)に対し0.035。
- KITTI odometry(シーケンス09/10、5枚スニペットATE): / であり、カメラに関する知識を全く用いないにもかかわらずキャリブレーション済みピンホールモデルに匹敵する。
- 水中の洞窟シーケンスとフロントガラス越しの魚眼ダッシュカム映像における質的結果を示し、整流化されたピンホールベースラインは意味のある予測を生成できない。
すべての実験で同一のアーキテクチャとハイパーパラメータを用いており、変化するのは学習用動画のみである。
SLAMにおける意義
ロボットが搭載するカメラは、ピンホールモデルではうまく記述できないもの(ドローンや車の魚眼レンズ、カタディオプトリックリグ)が増えており、個体ごとのキャリブレーションは導入コストになる。Neural Ray Surfacesは、カメラモデル自体をもう一つの学習可能な構成要素——微分可能なピクセル単位のレイフィールド——として扱えることを示し、自己教師あり深度・自己運動学習ツールキットを任意の光学系に拡張した。これは、与えられたセンサーに適応するSLAMフロントエンドへの一歩であり、異種の光学系にわたるキャリブレーション不要の幾何学習の基準点である。
関連ノート
- Camera models beyond pinhole — 学習によって置き換えられる古典的モデル
- SfM-Learner — この手法が一般化する自己教師あり深度+自己運動フレームワーク
- Depth from Videos in the Wild — 動画から内部パラメータを学習する密接に関連するアイデア
- MonoDepth — 深度のフォトメトリック自己教師あり学習の起源
- Camera calibration — NRSが回避する手動プロセス