- 主题技术
- 以原创技术系统为根基,SenseCore东升国际官网AI大装置为主题基座,布局多领域、多方向前沿钻研,
急剧买通AI在各个垂直场景中的利用,向行业赋能。
超清还不够,东升国际官网插帧算法让视频顺滑如丝丨NeurIPS 2019 Spotlight论文
自相机被发现以来,人们对更高画质视频的钻营就没有终场过。
分辨率从480p,720p,再到1080p,此刻有了2K、4K;帧率也从25FPS到60FPS,再到240FPS,960FPS甚至更高……
若是仅靠相机的硬件迭代来提升帧率,存在局限性,由于相机传感器在单元功夫内捉拿到的光有局限。并且相机硬件迭代的周期长,成本高。
最近,东升国际官网移动智能钻研总监孙文秀团队,提出了一种能够感知视频中活动加快度的视频插帧算法(Quadratic Video Interpolation),突破了之前插帧步骤的线性模型,将二次方光流预测和深度卷积网络进行融合,让你的视频顺滑如丝。(如您想对该团队更深刻相识,可查阅文章《GiveMeFive丨东升国际官网五年,从0到N的急剧进击》)
这种步骤有多严害?来看一个对比:

若是把视频放慢就能显著感触到,未经过插帧的慢放视频(左)会显著卡顿,而经过东升国际官网Quadratic(二次方)视频插帧步骤处置的视频(右)播放流畅。
这个步骤的论文被NeurIPS 2019接受为Spotlight论文,该步骤还在ICCV AIM 2019 VideoTemporal Super-Resolution Challenge角逐中获得了冠军(详情可查阅文章《东升国际官网科技57篇论文入选ICCV 2019,13项较量夺冠》)。
二次方插帧VS传统线性插帧
之前的视频插帧步骤(蕴含Phase[1]、DVF[2]、SepConv[3]和SuperSloMo[4]等)是如果相邻帧之间的活动是匀速的,即沿直线以恒定速度移动。然而,真实场景中的活动通常是复杂的、非线性的,传统线性模型会导致插帧的了局不正确。
以抛橄榄球的活动视频为例(如下图1),真实活动中的轨迹是一条抛物线,若是在第0帧和第1帧之间进行插帧,线性模型步骤仿照出来轨迹是线性轨迹(右二),与真实活动轨迹(右三)相差较大。

图1 传统线性模型与东升国际官网二次方视频插帧了局对比
但通过东升国际官网二次方视频插帧模型仿照出来的活动轨迹是抛物线形(图1右一),更逼近真实轨迹。也就是说,它可能更正确地估计视频相邻帧之间的活动并合成中央帧,从而获得更精准的插帧了局。
二次方插帧是怎么“炼”成的?
东升国际官网钻研团队构建了一个能够感知视频活动加快度的网络模型。与传统线性插帧模型利用两帧输入分歧,它利用了相邻四帧图像来预测输入帧到中央帧的光流,简易的流程图如下:

图2 二次方插帧模型的流程
、和
是输入视频陆续的四帧。给定肆意时刻t(00<t<1),该模型将最平天生t时刻的中央帧。而要得到
,就必要更深刻相识其中的两个关键技术:二次方光流预测和光流逆转。
其中,二次方光流预测,就是中学物里面常讲到的求匀变速活动位移的过程:如果在[-1, 1]时刻的活动是匀加快活动,那么能够利用位移揣摩出0时刻的速度和区间内的加快度,即能够推算出0时刻到肆意t时刻的位移:


图3:视频中物体活动的示意图
、
、
、
、
、
别离暗示物体,
,
,
中的地位
通过以上步骤,对称地我们能够推算出
。此时,我们得到了含有加快度信息
和
。
为了天生高质量的中央帧,我们必要得到反向光流
和
。
为此东升国际官网钻研团队提出一个可微分的“光流逆转层”来预测
和
。通过以下转换公式能够高效的将
和
和转化为
和
,但是可能会造成逆转的光流在活动天堑处出现强烈的振铃效应(见图4)。

为相识除这些强烈震荡的部门,东升国际官网钻研团队提出了一种基于深度神经网络的、可能对逆转后光流进行自适应采样的滤波器(Adaptive Flow Filter)。

尝试证明,自适应滤波器(ada.)可能显著减弱光流逆转造成的振铃效应,从而改善最终合成帧的质量。

图4 自适应滤波器可能改善
逆转的光流和合成的中央帧的质量
尝试了局
东升国际官网钻研团队在GOPRO、Adobe240、UCF101和DAVIS四个驰名视频数据集上对提出的步骤进行测评,并与业界前沿的插帧步骤Phase、DVF、SepConv和SuperSloMo进行比力。在每个数据集上,东升国际官网二次视频插针步骤都大幅超过现有的步骤(见表1、表2)。

表1 东升国际官网提出的步骤和业界前沿步骤
在GOPRO和Adobe240数据集上的比力

表2 东升国际官网提出的步骤和业界前沿步骤
在UCF101和DAVIS数据集上的比力

图5 对分歧步骤的插帧了局进行可视化。第一行和第三行是每种步骤的插帧了局和真实图像中央帧(GT)的均匀。第二行和第四行对每种步骤的插帧了局进行关键点跟踪。
综上,东升国际官网提出的可能感知视频中活动加快度的插帧步骤相比已有的线性插帧算法,可能过更好地预测中央帧。
[1]S.Meyer, O.Wang, H.Zimmer, M.Grosse, and A.Sorkine-Hornung. Phase-based frame interpolation for video.In CVPR, 2015
[2]Z.Liu,R.Yeh, X.Tang, Y.Liu, and A.Agarwala. Video frame synthesis using deepvoxel flow. In ICCV,2017.
[3]S.Niklaus, L.Mai, and F.Liu. Video frame interpolationvia adaptive separable convolution. In ICCV,2017
[4] H.Jiang, D.Sun, V.Jampani, M.Yang, E. G. Learned-Miller, and J.Kautz. Superslomo: High quality estimation of multiple intermediate frames for video interpolation. In CVPR, 2018.






返回