FlowNet 2.0

Ilg 2017 · 論文

一行要約 — 複数のFlowNetモジュールを中間ワーピングを挟んで積み重ね、専用の小変位サブネットワークを追加することで、FlowNetの推定誤差を50%以上削減し、インタラクティブなフレームレートで古典的な変分オプティカルフローに匹敵する初の深層学習手法となった。

問題

FlowNetはオプティカルフロー推定が学習問題として定式化できることを示したが、フロー品質における最高水準は依然として伝統的な変分手法によって定義されていた——特に小さな変位と実世界データにおいては、FlowNetは太刀打ちできなかった。単に単一のFlowNetを深く、あるいは広くしても改善しなかった。欠けていた要素は反復的な洗練であった:古典的な手法は粗い推定を段階的に洗練していくが、FlowNet 2.0はその機構を学習可能なパイプラインの内部に再構築する。

手法とアーキテクチャ

論文の3つの貢献がパイプラインを形成する:

1. データセットのスケジュール。 学習データの順序が重要である:まず単純なFlyingChairsでFlowNetS/FlowNetCを学習し、その後3DのFlyingThings3Dでファインチューニングすることが、どちらか単独または混合で学習するよりも一貫して優れている——推測としては、Chairsが一般的な色マッチングを教え、その後にネットワークが3D運動や照明に対する混乱を招く事前分布を発達させるということである。3つの学習率スケジュールが定義される(SshortS_{\mathit{short}}は60万反復、SlongS_{\mathit{long}}は120万反復、そして低学習率のファインチューニングスケジュールSfineS_{\mathit{fine}})。スケジュールの変更だけでFlowNetSの結果は約25%、FlowNetCは約30%改善し、同等条件で学習させた場合、FlowNetC(相関層を持つ)がFlowNetSを上回ることが示された。

2. ワーピングを伴う積層ネットワーク。 ブートストラップとなるFlowNetCはI1,I2I_1, I_2を受け取り、それに続くすべてのFlowNetSはI1I_1I2I_2、現在のフロー推定wi=(ui,vi)w_i = (u_i, v_i)^\top、それによってバイリニア補間でワーピングされた第2画像

I~2,i(x,y)=I2(x+ui, y+vi)\tilde{I}_{2,i}(x,y) = I_2(x + u_i,\ y + v_i)

および輝度誤差ei=I~2,iI1e_i = \lVert \tilde{I}_{2,i} - I_1 \rVertを受け取る。これにより各段はI1I_1I~2,i\tilde{I}_{2,i}の間の残りの増分だけを推定する。ワーピングは微分可能なので、スタック全体をエンドツーエンドで学習できるが、最良の結果は各ネットワークを一つずつ、以前のものを固定して学習することで得られる(ワーピングなしで積み重ねると過学習する)。スタックはその構成要素にちなんで名付けられる——FlowNet2-CSSはFlowNetCの後に2つのFlowNetSが続く。小文字はチャネル数が3/8の細いバリアントを示す。FlowNet2-CSSは単一のFlowNet2-Cより約30%、元のFlowNetCより約50%改善する;2つの小さなネットワークが1つの大きなネットワークを上回る(1100万重みのFlowNet2-ssが3800万重みのFlowNet2-Sを上回る)。

3. 小変位サブネットワークと融合。 実世界の映像(例えばUCF101)は大部分がサブピクセルの運動であり、既存の学習データにはそれが欠けている;著者らはChairsSDHom(小変位と均一背景を持つChairsスタイルのデータ)とFlowNet2-SD——最初の層からstride-2を除去し、7x7/5x5のカーネルを複数の3x3カーネルに置き換え、逆畳み込みの間に追加の畳み込みを入れてノイズを平滑化したFlowNetSのバリアント——を構築する。小さな融合ネットワークが両方の枝のフロー、フローの大きさ、ワーピングされた輝度誤差を受け取り、最終的な全解像度の推定値を出力する;この全体システムがFlowNet2と呼ばれる。

実験結果

SLAMにおける意義

FlowNet 2.0は、深層オプティカルフローが本当に使えるものになった瞬間だった:信頼できる精度を持ち、オンラインパイプラインに十分な速度を持ち、密なフローを視覚オドメトリのフロントエンドにとって現実的な要素にした。その積層・ワーピングによる反復洗練のパラダイムは直接PWC-Netへ、そして最終的にはRAFTの再帰的更新へと続いた——それは今日の学習型SLAMシステムの中核にある機構である——そしてそのChairs-then-Things3Dのカリキュラムはフローとステレオのネットワークを学習する標準的な実践となった。

関連ノート