FlowNet 2.0
Ilg 2017 · 論文
一行要約 — 複数のFlowNetモジュールを中間ワーピングを挟んで積み重ね、専用の小変位サブネットワークを追加することで、FlowNetの推定誤差を50%以上削減し、インタラクティブなフレームレートで古典的な変分オプティカルフローに匹敵する初の深層学習手法となった。
問題
FlowNetはオプティカルフロー推定が学習問題として定式化できることを示したが、フロー品質における最高水準は依然として伝統的な変分手法によって定義されていた——特に小さな変位と実世界データにおいては、FlowNetは太刀打ちできなかった。単に単一のFlowNetを深く、あるいは広くしても改善しなかった。欠けていた要素は反復的な洗練であった:古典的な手法は粗い推定を段階的に洗練していくが、FlowNet 2.0はその機構を学習可能なパイプラインの内部に再構築する。
手法とアーキテクチャ
論文の3つの貢献がパイプラインを形成する:
1. データセットのスケジュール。 学習データの順序が重要である:まず単純なFlyingChairsでFlowNetS/FlowNetCを学習し、その後3DのFlyingThings3Dでファインチューニングすることが、どちらか単独または混合で学習するよりも一貫して優れている——推測としては、Chairsが一般的な色マッチングを教え、その後にネットワークが3D運動や照明に対する混乱を招く事前分布を発達させるということである。3つの学習率スケジュールが定義される(は60万反復、は120万反復、そして低学習率のファインチューニングスケジュール)。スケジュールの変更だけでFlowNetSの結果は約25%、FlowNetCは約30%改善し、同等条件で学習させた場合、FlowNetC(相関層を持つ)がFlowNetSを上回ることが示された。
2. ワーピングを伴う積層ネットワーク。 ブートストラップとなるFlowNetCはを受け取り、それに続くすべてのFlowNetSは、、現在のフロー推定、それによってバイリニア補間でワーピングされた第2画像
および輝度誤差を受け取る。これにより各段はとの間の残りの増分だけを推定する。ワーピングは微分可能なので、スタック全体をエンドツーエンドで学習できるが、最良の結果は各ネットワークを一つずつ、以前のものを固定して学習することで得られる(ワーピングなしで積み重ねると過学習する)。スタックはその構成要素にちなんで名付けられる——FlowNet2-CSSはFlowNetCの後に2つのFlowNetSが続く。小文字はチャネル数が3/8の細いバリアントを示す。FlowNet2-CSSは単一のFlowNet2-Cより約30%、元のFlowNetCより約50%改善する;2つの小さなネットワークが1つの大きなネットワークを上回る(1100万重みのFlowNet2-ssが3800万重みのFlowNet2-Sを上回る)。
3. 小変位サブネットワークと融合。 実世界の映像(例えばUCF101)は大部分がサブピクセルの運動であり、既存の学習データにはそれが欠けている;著者らはChairsSDHom(小変位と均一背景を持つChairsスタイルのデータ)とFlowNet2-SD——最初の層からstride-2を除去し、7x7/5x5のカーネルを複数の3x3カーネルに置き換え、逆畳み込みの間に追加の畳み込みを入れてノイズを平滑化したFlowNetSのバリアント——を構築する。小さな融合ネットワークが両方の枝のフロー、フローの大きさ、ワーピングされた輝度誤差を受け取り、最終的な全解像度の推定値を出力する;この全体システムがFlowNet2と呼ばれる。
実験結果
- FlowNet 2.0はFlowNetの推定誤差を50%以上削減し、わずかに遅いだけで、最高水準の手法(Sintelでの FlowFields;ファインチューニング後のSintel finalでのDeepDiscreteFlow)と同等の性能をインタラクティブなフレームレートで達成する。PWC-Netの比較表に記載されている、ファインチューニング済みモデルのSintelテストEPEはclean 4.16/final 5.74である。
- 8から140fpsまでのバリアントの範囲があり;FlowNet2-sは元のFlowNetと同等の精度を140fpsで実現する。
- KITTI:KITTI2012+2015でのファインチューニングにより誤差はおおよそ3分の1に減少;KITTI2012で最良のEPE、非ステレオ手法の中でKITTI2015ベンチマーク1位。
- 実応用(モーション分割や行動認識)では、元のFlowNetは有用ではなかったが、FlowNet2は最高水準の伝統的なフローと同程度に信頼でき、桁違いに高速で、鮮明な運動境界を持ち、圧縮アーティファクトや均一な領域に対してロバストである。
SLAMにおける意義
FlowNet 2.0は、深層オプティカルフローが本当に使えるものになった瞬間だった:信頼できる精度を持ち、オンラインパイプラインに十分な速度を持ち、密なフローを視覚オドメトリのフロントエンドにとって現実的な要素にした。その積層・ワーピングによる反復洗練のパラダイムは直接PWC-Netへ、そして最終的にはRAFTの再帰的更新へと続いた——それは今日の学習型SLAMシステムの中核にある機構である——そしてそのChairs-then-Things3Dのカリキュラムはフローとステレオのネットワークを学習する標準的な実践となった。
関連ノート
- FlowNet — これが洗練する元のエンドツーエンドフローネットワーク
- PWC-Net — 同じ考え方をはるかに小さなアーキテクチャに蒸留した
- RAFT — 全ペア相関と再帰的更新を持つ現代の後継手法
- FlowFormer — 精度競争のTransformer時代の続き