东升国际官网

申请试用
登录
  • hd-share-img01
主题技术
以原创技术系统为根基 ,SenseCore东升国际官网AI大装置为主题基座 ,布局多领域、多方向前沿钻研 ,
急剧买通AI在各个垂直场景中的利用 ,向行业赋能。

CVPR 2018 | 东升国际官网科技Spotlight论文详解:基于孪生区域推荐网络的高机能单指标跟踪

2018-06-11

距离CVPR 2018大会越来越近 ,本文是东升国际官网科技在指标检测与跟踪领域 ,颁发的一篇CVPR 2018亮点汇报论文:基于孪生区域推荐网络的高机能单指标跟踪。该论文由东升国际官网科技见习钻研员李搏在钻研院副院长闫好汉和钻研员武伟共同领导下实现。


论文:基于孪生区域推荐网络的高机能单指标跟踪

作者:Bo Li, Junjie Yan, Wei Wu, Zheng Zhu, Xiaolin Hu


论文链接:http://openaccess.thecvf.com/content_cvpr_2018/CameraReady/2951.pdf


简介


本论文提出一种端对端的单指标跟踪算法 ,实现高机能的单指标视觉跟踪。现有的单指标跟踪算法通常很难两全跟踪机能和速度 ,只能在某一项指标占优。本文利用孪生(Siamese)网络和区域候选网络(Region Proposal Network) ,构建了一种高速且高精度的单指标跟踪算法。算法在整体框架上 ,可被分为孪生(Siamese)特点提取网络和区域推荐网络(Region ProposalNetwork)两个子网络 ,在一个统一的框架里实现端到端的训练和测试。


训练过程中 ,算法可能同时利用密集标注(VID)和稀少标注(YoutubeBB)的数据集进行训练 ,相迸宗现有步骤 ,稀少标注的数据集大大增长了训练数据起源 ,从而能够对深度神经网络进行更充分的训练;区域推荐网络中的坐标回归则能够让跟踪框更为正确 ,节俭了传统孪生跟踪网络中多尺度测试所需的额表推算。

尝试方面 ,本文跟踪算法能在维持160fps的高帧率情况下 ,在VOT2015和VOT2016等数据集上获得匹敌目前先进水平的了局。


设计思想


单指标视觉跟踪领域的主流步骤是以SiameseFC为代表的孪生网络结构 ,SiameseFC网络结构单一 ,通过统一网络提取一对图像的特点 ,通过有关(correlation)操作 ,能够实现指标模板与搜索图像区域中的17x17个幼图像的急剧比对 ,输出的17x17的响应图 ,描述每个图像搜索地位与指标模板的类似度。但SiameseFC有以下缺点:


首先 ,网络无法预测指标尺度上的变动 ,因而只能通过多尺度测试来判断指标尺度的变动 ,降低跟踪速度。


其次 ,输出的模板响应图分辨率较低 ,为了得到更高精度的地位 ,SiameseFC必要选取插值的步骤 ,将响应图分辨率放大16倍 ,达到与输入图像尺寸相近的大幼。


本文提出SiameseRPN算法 ,通过引入物体检测领域中的区域推荐网络(RPN) ,回归指标框地位 ,预防SiameseFC中响应图插值和多尺度测试等操作 ,既提升了速杜字得到更为精准的指标框。在训练过程中 ,算法可能使用大规模带稀少标注的视频数据集Youtube-BB进行训练 ,相较于SiameseFC仅使用的VID数据集 ,Youtube-BB数据集可能提供50倍数量的视频 ,保障了深度神经网络可能被充分的训练。


训练框架


图1展示了SiameseRPN的整体网络框架:

左边是用于提取特点的孪生(Siamese)网络;中央是区域推荐网络 ,蕴含了分类分支和回归分支 ,通过输入成对图像并进行有关(correlation ,图1钟装*”)等操作得到最后的输出。

eahrjh.jpg


图1:算法整体网络结构


图1右边部门展示了各输出通路的细节:在分类分支 ,输出的远景相信图蕴含2k个通路 ,别离暗示响应图每个地位k个锚点框的远景/布景的相信度;在回归分支 ,输出图蕴含4k个通路 ,别离暗示每个地位k个锚点框的坐标偏移量。


孪生网络


孪生网络用于提取输入图像的特点 ,分为模板分支和检测分支 ,均选取全卷积网络结构天生输入图像的视觉特点图。模板分支的输入为模板帧的指标图像 (z) ,而检测分支的输入为当前帧的图像 (x) ,φ(z)和φ(x)则别离代表两支网络输出的指标特点图和当前帧特点图。两支网络只有输入分歧 ,而权沉参数齐全一样 ,因而能够隐式的编码一样的图像视觉变动 ,合用于跟踪工作。


区域推荐网络


区域推荐网络掌管基于指标特点图φ(z)和当前帧特点图φ(x) ,及有关操作的了局(即1*17*17的响应图) ,预测指标的精准地位。若每个输出地位有k个锚点框(anchor box) ,那么网络必要为分类分支输出通路数为2k的相信图 ,为回归分支输出通路数为4k的偏移图。

因而在进行有关操作之前 ,网络使用卷积操作提升两个分支中特点图的通路数 ,将其别离提高为原来的2k倍和4k倍 ,图1中央部门的卷积用于提升特点图维度。提升维度后的特点图进行有关操作 ,得到分类和回归分支的输出。两支网络利用与指标检测中Faster R-CNN算法类似的损失函数 ,进行网络训练。


训练数据的组成


在训练阶段 ,Siamese网络所必要的训练样本对从VID和Youtube-BB数据集中以随机距离筛选天生。指标模板和检测帧图像来自于统一个视频中统一个物体的分歧两帧。两帧之间通常有肯定距离 ,但过远的距离可能使得指标表观的变动过大 ,使得网络难以训练。因而 ,在现实训练过程中均选取幼于100帧距离的图像对作为训练样本对。


固然在视频数量上Youtube-BB数据集弘远于VID数据集 ,但VID数据集蕴含Youtube-BB数据集所不具备的高帧率标注。本文观察到 ,一个好的跟踪网络既必要可能捉拿指标细粒度的变换(由VID数据集得到) ,又必要从更大数量级的视频中进建越发通用的指标特点和变动(通过Youtube-BB数据集进建) ,因而两个数据集的归并使用极度沉要 ,且必要调整好训练数据的比例。本文尝试中 ,VID和Youtube-BB的数据占比设为1:5。


awgrehg.jpg


图2:分歧量级训练数据对应的

最终模型跟踪机能


本文在分歧数量视频的训练集下训练SiameseRPN。如图2所示 ,最左边的跟踪精度代表只用VID作为训练集的情况 ,能够看出 ,随着数据不休的增长 ,在VOT2015和VOT2016测试集上跟踪机能均不休提升 ,Youtube-BB数据集的引入让算法在VOT2016上的EAO从0.317提升至0.344 ,超过VOT2016的冠军步骤CCOT ,并且从曲线趋向上来看 ,跟踪机能还没有趋于鼓和。这批注若是可能有更大量级的数据集 ,模型的跟踪精度可能进一步提升。这也就体现了数据驱动算法的优势。当指标跟踪与其它推算机视觉领域一样 ,出现了大量的跟踪数据集时 ,深度进建算法能够通过增长数据获得更好的机能 ,而传统的滤波步骤不能选取离线训练 ,也无法有效的利用大数量级的跟踪数据。


算法测试流程


与训练过程分歧 ,孪生网络的两支在测试过程中被分脱离(如图3所示) ,模板支只在指标初始帧前向传布一次 ,将用于远景相信度和偏移预测的特点图推算好以来保留至内存。而检测分支则在视频每一帧进行前向传布 ,得到对应的用于远景相信度和偏移预测的特点图 ,将其与模板对应的特点图进行有关操作以来 ,得到最终的远景/布景分类了局和指标框偏移回综合果。凭据这两个了局图 ,能够得到每个预测框的指标相信度 ,经过高斯窗口抑造和状态抑造 ,得到加权后的指标相信度。算法选出相信度最高的对应框 ,作为网络预测的最终指标地位。


rthw.jpg


图3:SiameseRPN算法测试流程


尝试了局


VOT2015了局


VOT2015数据集中蕴含60段视频。在测试过程中 ,当VOT工具包发现跟踪了局与现实指标地位沉合度为0时会沉启跟踪器 ,因而跟踪算法的机能由精度和鲁棒性两方面来评估。精度怀抱跟踪过程中均匀的指标框沉合度 ,而鲁棒性则衡量跟踪算法在测试视频上的迷失次数 ,VOT提出了EAO来综合这两项指标 ,作为排名凭据。分歧算法的跟踪精度如图4所示 ,本文提出的SiameseRPN算法能够在速度极高的情况下依然保障跟踪机能确当先 ,在速度和精度上均当吓宗第二名。


gstrhrj.jpg


图4:分歧跟踪算法

在VOT2015测试集的机能


VOT2016 了局


VOT2016测试数据集与VOT2015数据集一样 ,但是使用了更为更紧致的指标框 ,因而跟踪算法更容易迷失指标 ,造成跟踪沉启。分歧算法在VOT2016数据集的机能如图5所示 ,本文提出的算法与榜单上的前25名的算法进行了对比 ,SiameseRPN算法依然可能在该数据集夺得第一名 ,其速度(160fps)是VOT2016冠军算法的500倍。

ergrth.jpg



图5:分歧跟踪算法

在VOT2016测试集的机能

VOT2017 数据集实时跟踪了局


在VOT2017数据集中 ,VOT中10段最单一的视频被代替为了十段较难的视频。同时尝试新增了实时角逐 ,要求跟踪算法必须可能在每秒处置20帧图像。若算法不能在50ms内实现处置当前帧 ,则使用上一帧了局包办。该划定导致速度较慢的跟踪算法会迷失多帧跟踪了局 ,无法有效跟踪指标。


ferhsh.jpg


图6:分歧跟踪算法

在VOT2017测试集的实时跟踪机能


如图6所示 ,本文算法在实时跟踪榜单同样排名第一 ,0.24均匀沉合率的成就较第二名CSRDCF++均匀沉合率提高3个点 ,同时相较于SiameseFC算法(实时榜单的冠军) ,均匀沉合率提高6个点。尝试了局极度有力地证了然本文算法可能在高帧率的同时保障精准的跟踪精度。


OTB2015数据集了局


OTB数据集由跟踪社区时时使用的视频中遴选出的100段视频组成 ,重要评测指标蕴含成功和精度的曲线。精度曲线怀抱预测框与标注中心点幼于某像素的帧的占比;成功率曲线则怀抱预测框与标注框的沉合度超过某一阈值的帧的占比。本文将孪生区域推荐网络和几个比力有代表性的算法进行了对比 ,蕴含PTAV、CREST、SINT、CSR-DCF、SiameseFC、Stape、CFNet、DSST。了局如图7所示 ,本文提出的算法能够在OTB2015的两个指标上均获得第一。由于引入了区域推荐网络 ,新算法能够比基础算法SiameseFC提高5个点。


sghrj.jpg


图7:分歧跟踪算法在OTB2015数据集上的

成功率曲线和精度曲线


结论


本文利用孪生网络和区域推荐网络 ,构建了一种高速且高机能的单指标跟踪算法。算法中设计的坐标回归能够让跟踪框越发正确 ,并且省去多尺度测试耗费的功夫。在尝试中 ,本文跟踪算法能在维持高速的情况下(160fps) ,在VOT2015和VOT2016数据集上均达到当先的单指标跟踪水平。


ewrth.jpg

产品试用
填写此单一表格 ,我们将尽快联系您!
商务合作
400 900 5986
周一至周五 9:00-12:00 ,13:00-18:00
合作同伴招募
【网站地图】