- 主题技术
- 以原创技术系统为根基,SenseCore东升国际官网AI大装置为主题基座,布局多领域、多方向前沿钻研,
急剧买通AI在各个垂直场景中的利用,向行业赋能。
商研丨事俘宰割的进阶三级跳:从Mask R-CNN到Hybrid Task Cascade

编者按:早在2018年的COCO角逐中,东升国际官网科技钻研员和香港中文大学-东升国际官网结合尝试室(MMLab)同学组成的团队,在最主题的物体检测(Detection)项目中独占鳌头。东升国际官网团队创造性地开发了全新的技术,尤其是提出了新的多工作混合级联架构(Hybrid Task Cascade),通过把分歧子工作进行逐级混合,有效地改善了整个检测过程中的信息流动。
近日,基于 COCO 2018角逐团队合作的成就,MMLab团队又获得新突破,颁发了论文《Hybrid Task Cascade for Instance Segmentation》,该论文已入选CVPR 2019。论文提出了一种新的事俘宰割框架,设计了多工作多阶段的混合级联结构,并且融合了一个语义宰割的分支来加强Spatial Context。这种框架获得了显著优于Mask R-CNN和Cascade MaskR-CNN的了局。本文是对《Hybrid Task Cascade for Instance Segmentation》的论文解读。
布景
事俘宰割(Instance Segmentation)是一个和物体检测极度有关但是更难的问题,在物体检测的基础上,还要求宰割出物体的像素,如下图所示。

事俘宰割这个问题近几年的发展在很大水平上是由COCO数据集和角逐推动的。从MNC,FCIS到PANet,都是在COCO Instance Segmentation Track 上拿第一名的步骤。Mask R-CNN是个例表,由于Paper公开得比力早,所所以2017年前几名行列的根基步骤。同理可知,Hybrid Task Cascade(HTC)在 COCO 2018 的角逐中也获得了第一名。
概述
级联是一种比力经典的结构,在好多工作中都有效到,好比物体检测中的CC-Net,CascadeR-CNN,语义宰割中的Deep Layer Cascade等等。然而将这种结构或者思想引入到事俘宰割中并不是一件直接而容易的事件,若是直接将Mask R-CNN和Cascade R-CNN结合起来,获得的提升是有限的,因而我们必要更多地索求检测和宰割工作的关联。
在本篇论文中,我们提出了一种新的事俘宰割框架,设计了多工作多阶段的混合级联结构,并且融合了一个语义宰割的分支来加强Spatial Context。这种框架获得了显著优于Mask R-CNN和Cascade Mask R-CNN的了局。

步骤
整个框架的演进能够用四张图来暗示,其中M暗示Mask分支,B暗示Box分支,数字暗示Stage,M1即为第一个Stage的Mask分支。

进阶筹备:Cascade Mask R-CNN
由于Cascade R-CNN在物体检测上的了局极度好,我们首先尝试将Cascade R-CNN和Mask R-CNN直接进行杂交,得到子代Cascade Mask R-CNN,如上图(a)所示。在这种实现里,每一个Stage和Mask R-CNN 类似,都有一个Mask分支和Box分支。当前Stage会接受RPN或者上一个Stage回归过的框作为输入,而后预测新的框和Mask。这也是尝试中我们所比力的Baseline,从尝试表格能够看到其实这个Baseline已经很强了,但是依然存在显著的问题,重要在于Cascade MaskR-CNN相比Mask R-CNN在Box AP上提高了3.5个点,但是在Mask AP上只提高了1.2个点。
进阶第一步:Interleaved Execution
Cascade R-CNN固然强行在每一个Stage里面塞下了两个分支,但是这两个分支之间在训练过程中没有任何交互,它们是并行执行的。所以我们提出Interleaved Execution,也即在每个Stage里,先执行Box分支,将回归过的框再交由Mask分支来预测Mask,如上图(b)所示。这样既增长了每个Stage内分歧分支之间的交互,也解除了训练和测试流程的Gap。我们发现这种设计对Mask R-CNN和Cascade Mask R-CNN 的Mask分支都有肯定提升。

这一步起到了很沉要的作用,对通常Cascade结构的设计和改进也拥有借鉴意思。我们首先回首原始Cascade
R-CNN的结构,每个Stage只有Box分支。当前Stage对下一Stage产生影响的蹊径有两条:(1)
的输入特点是
预测出回归后的框通RoI Align获得的;(2)
的回归指标是依赖
的框的预测的。这就是Box分支的信息流,让下一个Stage的特点和进建指标和当前Stage有关。在Cascade的结构中这种信息流是很沉要的,让分歧Stage之间在逐措施整而不是类似于一种Ensemble。
然而在Cascade Mask R-CNN 中,分歧Stage之间的Mask分支是没有任何直接的信息流的,
只和当前
通过RoI Align有关联而与
没有任何联系。多个Stage的Mask分支更像用分歧散布的数据进行训练而后在测试的时辰进行Ensemble,而没有起到Stage间逐措施整和加强的作用。为相识决这一问题,我们在相邻的Stage的Mask分支之间增长一条衔接,提供Mask分支的信息流,让能
知路
的特点。具体实现上如下图中红色部门所示,我们将
的特点经过一个1x1的卷积做Feature embedding,而后输入到
,这样
既能得到Backbone的特点,也能得到上一个Stage的特点。

进阶第三步:Semantic Feature Fusion
这一步是我们尝试将语义宰割引入到事俘宰割框架中,以获得更好的Spatial Context。由于语义宰割必要对全图进行精密的像素级的分类,所以它的特点是拥有很强的空间位相信息,同时对远景和布景有很强的分辨能力。通过将这个分支的语义信息再融合到Box和Mask分支中,这两个分支的机能能够得到较大提升。
在具体设计上,为了最大限度和事俘宰割模型复用Backbone,削减额表参数,我们在原始的FPN的基础上增长了一个单一的全卷积网络用来做语义宰割。首先将FPN的5个level的特点图Resize到一样大幼并相加,而后经过一系列卷积,再别离预测出语义宰割了局和语义宰割特点。这里我们使用COCO-Stuff的标注来监督语义宰割分支的训练。红色的特点将和原来的Box和Mask分支进行融合(鄙人图中没有画出),融合的步骤我们也是选取单一的相加。

进阶了局
通过上面的几步,在使用ResNet-50的Backbone下,相对Cascade Mask R-CNN能够有1.5个点的Mask AP提升,相对Mask R-CNN能够有2.9个点的提升。在COCO 2017 val子集上的逐步对比试验如下表所示。

除了纯净版HTC之表,在Paper里我们还给出了在COCO Challenge里面用到的所有步骤和技巧的涨点情况(良心买卖有木有)。

总结
1、多工作多阶段的混合级联结构。
2、训练时每个Stage内Box和Mask分支选取交替执行。
3、在分歧Stage的Mask分支之间引入直接的信息流。
4、语义宰割的特点和原始的Box/Mask分支融合,加强Spatial Context。
Code
照例将Release到MMDetection
(https://github.com/open-mmlab/mmdetection),欢迎 watch。
Arxiv
Hybrid Task Cascade for Instance Segmentation
(https://arxiv.org/abs/1901.07518)





返回