DEVO
Klenk 2024 · 論文
一行要約 — DEVO(Deep Event Visual Odometry)は、DPVO風の学習型スパースパッチオドメトリ・アーキテクチャを単眼イベントストリームに適応させたものであり、シミュレートされたイベントのみで訓練され、実世界のイベントベンチマークに汎化して、従来のイベントのみの手法に対して姿勢追跡誤差を最大97%削減する。
問題
イベントカメラは高速運動時や悪条件の照明下でのカメラ追跡を約束するが、既存のイベントベースの単眼VOは最近のベンチマークで限られた性能しか示していなかった。これを補うために、多くのシステムはIMU、ステレオイベントカメラ、フレームベースカメラといった追加センサを加えていたが、これらはコストを増大させ、システム要件(スペース、電力、キャリブレーション)を複雑化させるうえ、フレームカメラに依存することは、まさにイベントが避けようとしていたモーションブラーとHDRの脆弱性を再導入してしまう。DEVOが問うのは、追加センサを一切用いない、汎用で実世界向けの単眼イベントのみのVOの限界はどこにあるのか、である。
手法とアーキテクチャ
イベント表現。 イベント はボクセルグリッド にビン分けされる(5つの時間ビンにわたるイベント数のバイリニア補間を、平均0・分散1に正規化したもの)。訓練時には各ボクセルグリッドに真値の姿勢 と逆深度マップ が対応付けられる。
DPVO風のバックボーン。 DEVOはDPVOの動的パッチグラフと再帰的更新演算子を再利用する。 上のスパースなイベントパッチは近隣のボクセルグリッドに接続され、更新演算子はオプティカルフローの修正 と信頼度重み を反復的に予測し、微分可能バンドル調整(DBA)層がキーフレームのスライディングウィンドウにわたってカメラ姿勢とパッチ深度を更新する。
深層イベントパッチ選択(主な新規性)。 イベントは画像平面をスパースにしか覆わないため、ランダムまたは勾配ベースのパッチサンプリングは空領域やノイズ領域に容量を浪費してしまう。小さなCNN(8/16/32チャンネルの3×3 conv+ReLU層を3つ、続いて1チャンネル層、4×4最大プーリング、シグモイド)が、追跡可能な座標を強調するスコアマップ を予測する。これはスコアのラベルなしで、自己教師あり損失
によって訓練される。この損失は、フロー残差 が大きいか、DBA重み が小さい箇所でスコア を押し下げる。全体の損失は である。推論時には、パッチはプールされた多項サンプリングによって選ばれる。スコアマップを4×4平均プーリングし、格子セルにわたる多項分布から非復元抽出で座標をサンプリングし、それぞれの4×4ウィンドウ内で精緻化する。これはtop-選択よりもスコアマップの外れ値に対してロバストである。
シミュレーションのみの訓練。 イベントはESIMを用いて、TartanAirの全シーケンスに対して、イベント生成モデル でシミュレートされる。コントラストしきい値はシーケンスごとにランダム化され 、さらにシム-トゥ-リアルギャップを縮小するための光度的なボクセル拡張が加えられる。訓練は、2台のA40 GPUで24万イテレーション、シーケンス長 、パッチ数 (約2.5日)。
実験結果
- 7つの実世界ベンチマーク(UZH-FPV、VECtor、HKU、EDS、TUM-VIE、RPG、MVSEC)で評価され、5回の実行の中央値を用い、どのデータセットでも同一のパラメータを使用している(キーフレームしきい値のみデータセットごとに変える)。指標はATE[cm]、回転RMSE、MPE[%/m]。要点として、従来のイベントのみの手法に対して姿勢追跡誤差を最大97%削減している。
- UZH-FPV(ドローンレース): 9シーケンス中4つで最良、他の成功している手法はすべてIMUを使用しているにもかかわらずである。DPVOとEVOは全シーケンスで失敗する。
- VECtor: EVOとESVOはそれぞれ88%と76%のシーケンスで失敗する。DEVOはステレオイベント+ステレオフレーム+IMUを用いるESVIOにさえ70%のシーケンスで勝る。
- HKU: 9シーケンス中5つで最良。EVOとESVOは全シーケンスで失敗する。
- TUM-VIE: すべてのイベントのみの手法よりも少なくとも44%低いATE。RPG: イベントのみの手法よりも少なくとも63%低いATE、平均ATEはUSLAMより88%、EDSより28%低い。
- コード、訓練コード、イベントデータ生成はオープンソースである(github.com/tum-vision/DEVO)。
SLAMにおける意義
DEVOは、深層学習によるVOの革命がイベントカメラに到達した瞬間を印づけている。古典的なイベントオドメトリ(EVO、ESVO)はノイズとスパース性に苦しむ手作業設計のアライメント目的関数に依存しているが、DEVOの学習型フロントエンドはそれらの影響をデータから吸収する。そのシミュレーションのみの訓練戦略は、おそらく最も影響力のある部分であり、イベントデータのボトルネックを回避する実用的な道筋を示し、フレームベース手法を一変させたスケーリングの力学をイベントSLAMに開くものである。