PWC-Net

Sun 2018 · 论文

一句话总结 — 基于三条经典原则——金字塔(Pyramid)、变形(Warping)、代价体(Cost volume)——构建的紧凑光流网络,体积比FlowNet2小17倍、推理速度快2倍,同时在主要基准测试上精度更高。

问题

FlowNet证明了光流可以端到端地学习,但要达到经典方法的精度水平,需要用到FlowNet2——一个内存占用达640MB的网络堆栈,其子网络必须依次训练以避免过拟合。

数十年的经典光流研究早已发现了让光流估计行之有效的要素:由粗到精的金字塔、图像变形以及匹配代价体。PWC-Net探究的问题是:将这些简单、成熟的原则直接嵌入架构,能否得到一个同时更小、更易训练且比暴力堆叠网络更精确的模型。

方法与架构

cwl(x)=c2l(x+up2(wl+1)(x))c_w^l(\mathbf{x}) = c_2^l\big(\mathbf{x} + \mathrm{up}_2(\mathbf{w}^{l+1})(\mathbf{x})\big)

该操作通过双线性插值实现(可微),因此每一级只需估计一个残差运动——大位移在像素值较小的粗层级上得到处理。

cvl(x1,x2)=1Nc1l(x1)cwl(x2),x1x2d\mathbf{cv}^l(\mathbf{x}_1, \mathbf{x}_2) = \frac{1}{N}\, c_1^l(\mathbf{x}_1)^\top c_w^l(\mathbf{x}_2), \qquad |\mathbf{x}_1 - \mathbf{x}_2|_\infty \le d

该计算仅在每级搜索范围d=4d = 4像素内进行——顶层的1像素运动等价于全分辨率下的2L12^{L-1}像素,因此很小的搜索范围就足够了。变形层和代价体层不含任何可学习参数,从而缩小了模型体积。

实验结果

对SLAM的意义

稀疏光流为直接法/稠密SLAM前端、动态物体推理以及自监督深度训练提供了数据关联。PWC-Net使高质量光流的计算成本足够低,可用于实时机器人流水线,并确立了金字塔-变形-代价体设计作为深度光流的标准架构——这也是后来RAFT提出全对相关性时所对照的基准。其由粗到精带来的局限(小而快速移动的物体在粗层级上消失,且粗层级的误差被锁定)恰恰是RAFT旨在解决的失效模式。

相关条目