东升国际官网

申请试用
登录
  • hd-share-img01
主题技术
以原创技术系统为根基,SenseCore东升国际官网AI大装置为主题基座,布局多领域、多方向前沿钻研,
急剧买通AI在各个垂直场景中的利用,向行业赋能。

基于并行点检测和点匹配的单阶段实时HOI Detection步骤

2020-05-27


1.png

代码链接:https://github.com/YueLiao/PPDM

论文链接:https://arxiv.org/abs/1912.12898


导读:在CVPR2020上,东升国际官网3D&AR-身份认证与视频感知团队结合北京航空航天大学Colab(可乐尝试室)提出了基于并行点检测和点匹配的单阶段HOI Detection步骤,为学术界初次在HOI Detection领域达到及机遇能的深度进建算法,并且在公开数据集HICO-DET上机能获得了大幅度提升。同时本文还构建了一个以现实利用场景为导向的HOI Detection数据库HOI-A。


动机与布景

问题界说: HOI Detection (人和物体的作为交互检测) 是一个针对静态图片对人体作为的精密化理解,工作要求检测出图片中产生作为的人以及和他产生作为交互的物体,同时还要将二者的作为关系预测出来并关联起来。

a.png

 

传统两阶段HOI Detection步骤:第一阶段,通过一个预训练好的指标检测网络检测出图片中的人和物体,而后把人和物体框逐一配对得到一系列的<人,物体>候选对 (HO Proposals)。第二阶段,把每一个HO Proposal逐一送入到一个作为关系分类网络,得到对应的预测出对应作为关下粪别。

b.png

 

两阶段步骤的局限性:从机能上,两阶段模型的结构是序列化和分离化的,第二阶段分类的机能会依赖于第一阶段检测的机能。而第一阶段在天生Proposals时仅思考检测相信度较高的人/物体,而忽视一幼我/物体产生交互关系的可能性,从而会导致有交互关系的人/物体味被漏掉,或者在第二阶段受到“不放在眼里“。此表,逐一组队产生proposals的方式会天生大量负样本,增大搜索空间,增长正样本被检出并赋予高相信度的难度。从效能上,第一阶段产生的所有样本,蕴含大量的负样本,都要逐个串行的输入到第二阶段的关系预测网络,线性的增长了功夫复杂度。此表,为了获得较好的机能,第一阶段往往会选取机能更好的检测模型,也会增长功夫开销。

 

重要贡献

1.基于两阶段步骤的局限性,我们沉新界说了HOI Detection为一个并行点检测和并行点匹配的问题,并提出全新的单阶段HOI Detection框架(PPDM)。

2.我们提出的PPDM框架不仅在公开数据集HICO-DET以及我们构建的HOI-A数据集上获得了最优的机能,还成为第一个在HOI Detection领域达到及机遇能的深度进建框架。

3.我们构建了一个以现实利用为导向的HOI Detection数据库。

c.png

步骤介绍

问题沉界说:

l  人/物体检测框:检测框的中心点+检测框长宽以及中心点的误差 ;

l  交互关系点:人和物体检测框中心点连线的中点。为一个衔接人和物体的锚点,也在此点来预测对应人和物体之间的关系。

l  匹配规定:首先界说了两个误差,别离从交互关系点到人和物体框的中心点。结合交互关系点和对应的误差找到最切合匹配规定的人和物体中心点。匹配到统一个关系点的人和物体即可组成一个HOI三元组。

d.png

网络结构:基于以上界说我们提出一个由并行双支路组成的单阶段框架。首先通过一个特点提取网络,得到图片的特点,而后经由两条支路得到HOI三元组。第一条支路为“点检测“支路,输入图片的特点,输出人/物体/交互关系点的热力争以及对应人/物体检测框的长宽。第二条支路为“点匹配” 支路,输入图片特点,输出交互关系点到人/物体检测框中点的误差。

22.png

点匹配详解:我们首先遴选出相信度最高个k个交互关系点以及对应的误差,基于此,我们能够天生一系劣装coarse human/object point”。而后,我们基于“离‘coarse point’最近且拥有较高相信度”的匹配规定,找到每个交互关系点所匹配的人和物体中心点。最后结合人和物体中心点对应地位预测出来的长宽便可得到最后的HOI三元组。

e.png

HOI-A数据集

以现实落地利用场景为导向,我们拔取了极度有限但极具实用价值的10种作为关系,通过摄像头采集以及网络爬取的方式,采集了将近4万张以报答中心的场景图片,并对所有图片进行了精密的HOI Detection标注。为了增大类间差距,图片蕴含丰硕的场景(室内,室表,车内灯),分歧的光照强度,分歧的人物着装,和统一类物体的分歧状态,并选取两种摄像头来采集,RGB和IR。

f.png

尝试了局

我们拔取了两种分歧的主干网络DLA-34和Hourglass-104在两个数据库HICO-DET和HOI-A上对东升国际官网步骤PPDM进行一系列尝试。

从定量了局上能够得到,在HICO-DET数据库上,我们在不选取额表信息,如人体姿势,说话特点等的情况下,获得了最优的机能,并且速度远远快于之前的步骤,其中基于DLA-34的框架,为在HICO-DET上第一个达到及机遇能的算法。

g.png

鄙人图中我们对比了经典的两阶段步骤iCAN,其中我们对每张图片top-3得分HOI三元组进行了可视化,其中第一行为iCAN的了局,第二行为PPDM的了局。从定性了局能够分析得到,东升国际官网算法能够检测出真正拥有关系的人和物体对并给出较高的相信度得分,而iCAN[]往往会左袒于给易于检测但现实没有现实关系的人和物体对较高的得分,从而产生误检。

h.png

 

总结与瞻望

在本文中,我们提出一套单阶段实时的HOI Detection解决规划,并构建了一个以现实利用为导向的HOI Detection数据库。但愿我们提出的步骤和数据库能够缩幼HOI Detection学术界和产业界的天堑。在步骤层面,若何在东升国际官网框架下高效合理的利用越发细粒度的人体姿势信息来提高作为识此外正确性是一个改进方向。在数据库层面,在将来我们会不休的扩大和丰硕东升国际官网HOI-A数据库,来推动领域发展。


产品试用
填写此单一表格,我们将尽快联系您!
商务合作
400 900 5986
周一至周五 9:00-12:00,13:00-18:00
合作同伴招募
【网站地图】