Event cameras (DVS)
イベントカメラ、すなわちDynamic Vision Sensor (DVS) は、すべてのピクセルが独立かつ非同期に動作する生体模倣型カメラである。固定レートで完全な輝度フレームを取得する代わりに、各ピクセルはその位置における対数輝度を監視し、変化がコントラスト閾値を超えた瞬間にイベントを発火する。出力は画像の連続ではなく、マイクロ秒単位の時間分解能を持つスパースで連続的なイベントストリームである。
イベント生成モデル
各イベントはタプル
であり、 はピクセル座標、 はタイムスタンプ(マイクロ秒分解能)、 は輝度が上昇したか下降したかを示す極性である。発火条件は以下の通りである。
ここで 輝度、– はセンサーのファームウェアで設定されるコントラスト閾値である。比較が対数空間で行われるため、センサーは相対的な輝度変化に応答する——これが巨大なダイナミックレンジをもたらす所以である。
イベントはどこから来るのか——動くエッジ
短い時間間隔では、あるピクセルにおける輝度変化は輝度恒常性の線形化によって良く近似される。
つまり、変化は画像勾配とオプティカルフローの内積に等しい。この式には2つの読み方があり、イベントベースビジョンの多くを駆動している。
- イベントは動く輝度エッジで発火する。 (テクスチャのない領域)または (相対的な動きがない)の場所では、イベントは発火しない。イベントストリームは本質的に、シーンのエッジが動く様子を記録した映像である。
- イベントは勾配+動きから予測可能である。 輝度画像と動きの仮説が与えられれば、イベントパターンを予測できる——これは特徴追跡のためのEKLTや直接アラインメントのためのEDSが利用する生成モデルであり、動き推定のためのcontrast maximizationの基盤でもある。
この設計の実用的な帰結
- データは動きに駆動される: 静止したシーンを見る静止カメラは(ほぼ)何も出力しない。これは電力・帯域幅の観点では利点だが、SLAMの観点では問題となる——Challengesを参照。
- グローバルシャッターも露光時間もない: ブレるフレームというもの自体が存在せず、各イベントはエッジがピクセルを通過した正確な瞬間を符号化する。
- 非同期出力: 自然な「フレームレート」というものは存在せず、アルゴリズムはイベントを一つずつ処理するか、中間表現に集約する必要がある(Event representationsを参照)。
- ノイズは実在する: 物理センサーはスプリアスなイベントを発生させ、実効的な閾値 は個体差や温度によって変動する——実運用システムにおいては実際的なキャリブレーションの課題である。
フレームカメラ対イベントカメラ
| 特性 | フレームカメラ | イベントカメラ (DVS) |
|---|---|---|
| 出力 | 固定レートの完全な画像 | スパースな非同期イベントストリーム |
| 時間分解能 | 約10〜100 ms | 約1 µs |
| ダイナミックレンジ | 約60 dB | 140 dB以上 |
| モーションブラー | あり(露光による) | なし |
| 絶対輝度 | あり | なし(変化のみ) |
| データレート | 一定(解像度×fps) | シーンの活動量に応じて変化 |
ハードウェアの現況
一般的なハードウェアには、iniVationのDAVISファミリーやProphesee Metavisionセンサー(Sony製造のIMX636世代を含む)がある。DAVISの設計はSLAMにとって特に重要である。なぜなら、共有光学系の背後にある一つのチップ上で、DVSと標準的なフレームセンサー(APS)、そしてIMUを共存させており、一つのデバイスから完全に位置合わせされたイベント、フレーム、慣性データを提供するからである。これはまさに、Ultimate-SLAMのような融合システムやEKLTのようなハイブリッドトラッカーの背後にあるハードウェアの前提である。
ハードウェアなしに始めるには、Gallego 2020のサーベイが標準的な読み物であり、Event Camera DatasetとMVSEC/DSECが標準的なベンチマークであり、ESIMやv2eのようなシミュレータは通常のビデオから合成イベントを生成する——これはDEVOのような学習型システムが用いる訓練データの経路である。コミュニティ管理のAwesome-Event-based-Visionリポジトリはこれらすべてを索引している。
SLAMにおける意義
イベントカメラは、フレームベースの視覚SLAMが破綻するまさにその条件——高速な動き(モーションブラー)、高ダイナミックレンジのシーン(飽和)、低照度——に対応する。そのマイクロ秒単位のレイテンシは、30〜60 Hzを大きく超えるレートでの状態推定を可能にし、これはクアッドロータのような機敏なロボットにとって重要である。しかし、まったく異なる出力形式のため、古典的なSLAMフロントエンドを直接適用することはできず、このセンサーを中心に新しいアルゴリズムの一群(EVO、ESVO、EKLT、Ultimate-SLAM、DEVO)を開発する必要があった。