东升国际官网

申请试用
登录
  • hd-share-img01
主题技术
以原创技术系统为根基,SenseCore东升国际官网AI大装置为主题基座,布局多领域、多方向前沿钻研,
急剧买通AI在各个垂直场景中的利用,向行业赋能。

CVPR 2018 | 东升国际官网科技论文详解:基于空间特点调造的图像超分辨率

2018-05-27

东升国际官网科技在CVPR 2018颁发论文44篇,登科论文在以下领域实现突破:大规模散布式训练、人体理解与行人再鉴别、自动驾驶场景理解与分析、底层视觉算法、视觉与天然说话的综合理解、物体检测、鉴别与跟踪、深度天生式模型、视频与行为理解等。


以下是在底层视觉算法领域,东升国际官网科技提出的面向天生更天然真实纹理图像的超分辨率算法。本文为东升国际官网科技CVPR 2018论文解读第3期。


论文:Recovering Realistic Texture in Image Super-resolution by Deep Spatial Feature Transform

作者:Xintao Wang, Ke Yu, Chao Dong, Chen Change Loy


论文链接:

https://arxiv.org/abs/1804.02815

Project page:

http://mmlab.ie.cuhk.edu.hk/projects/SFTGAN/


简介


单帧图像超分辨率旨在基于单张低分辨率图像复原对应的高分辨率图像。卷积神经网络近年在图像超分辨率工作中阐发出了优异的沉建成效,但是复原出天然而真实的纹理依然是超分辨率工作中的一大挑战。


若何复原出天然而真实的纹理呢?一个有效的方式是思考语义类别先验,即便用图像中分歧区域所属的语义类别作为图像超分辨率的先验前提,好比天空、草地、水、构筑、丛林、山、植物等。分歧类别下的纹理占有各自怪异的个性,换句话说,语义类别可能更好的约束超分辨中统一低分辨率图存在多个可能解的情况。如图1中展示的构筑和植物的例子,它们的低分辨率图像块极度类似。固然结合天生匹敌式网络(GAN)进行超分复原,若未思考图像区域的类别先验信息,获得的了局固然增长了纹理细节,但是并不切合图像区域自身应该拥有的纹理特点。


arghrh.jpg


图1:

分歧的语义先验对

构筑和植物区域图像超分辨率的影响


在结合语义类别先验的过程中会遇到两个问题。第一个问题是,若何表白语义类别先验,出格是当一个图像中存在多种语义类别时。本文选择了语义宰割概率图作为先验前提,其能提供像素级的图像区域信息,每个像素点的概率向量可能更精密地调控纹理了局。第二个问题是,若何有效地将语义先验结合到网络中去。本文提出了一种新的空间特点调造层(SFT),它能将额表的图像先验(好比语义宰割概率图)有效地结合到网络中去,复原出与所属语义类别特点一致的纹理。


最终了局显示(如图2所示)和现有的SRGAN模型以及EnhanceNet模型相比,使用空间特点调造层的超分辨率网络可能天生越发天然的纹理,复原出的高分辨率图像视觉成效更为真实。


shthhj.jpg

图2:

在4倍超分辨率下,

SRCNN、SRGAN、EnhanceNet

和本文提出SFT-GAN算法最终了局的比力


空间特点调造


本文提出的空间特点调造层受到前提BN层的启发,但是前提BN层以及其他的特点调造层(好比FiLM),往往忽略了网络提取特点的空间信息,即对于统一个特点图的分歧地位,调造的参数维持一致。但是超分辨率等底层视觉工作往往必要思考更多的图像空间信息,并在分歧的地位进行分歧的处置;谡飧龈畔,本文提出了空间特点调造层,其结构如图3所示。


arfghh.jpg

图3:

空间特点调造层的结构


空间特点调造层对网络的中央特点进行仿射变换,变换的参数由额表的先验前提(如本文中思考的语义宰割概率图)经过若干层神经网络变换得到。若以F暗示网络的特点,γ 和 β 别离暗示得到的仿射变换的尺度和平移参数,那么经过空间特点调造层得到的输出特点为:


rghghh.webp.jpg


空间特点调造层能够方便地被集成至现有的超分辨率网络,如SRResNet等。图4是本文中使用的网络结构。为了提升算法效能,先将语义宰割概率图经过一个Condition Network得到共享的中央前提,而后把这些前提“广播”至所有的SFT层。本文算法模型在网络的训练中,同时使用了perceptual loss和adversarial loss,被简称为SFT-GAN。


ragrghg.jpg


尝试了局


语义宰割了局


如图5所示,当前基于深度进建的语义宰割网络在低分辨率数据集上进行fine-tune后,对于大无数场景可能天生较为中意的宰割成效。


rhgtjhj.jpg

图5:

语义宰割了局


SFT-GAN和其他模型的了局比力


图6展示了SFT-GAN模型和其他模型了局的比力,能够看到基于GAN的算法模型SRGAN、EnhanceNet以及本文的SFT-GAN在视觉成效上超过了以优化PSNR为指标的模型。SFT-GAN在纹理的复原上可能天生比SRGAN和EnhanceNet更天然真实的了局(图中的动物毛发、构筑物的砖块、以及水的波纹)。


vrfbtrhn.jpg

图6:

本文SFT-GAN模型

和现有超分辨率模型的了局对比


在进行的人类用户评价中,SFT-GAN模型在各个语义类别上也比之前的基于GAN的步骤有着显著的提升(如图7所示)。


vdfhbrtj.jpg

图7:

人类用户评价分歧算法成效


其他尝试探索


本文还可视化了语义宰割概率图和特点调造层参数的关系。图8中展示了构筑和草地类此外概率图以及网络中某一层的调造参数的联系  D芄豢吹,调造参数和语义宰割概率图有着缜密的联系,同时在调造参数中分歧类此外界限仍旧比力清澈。


sbrth.jpg

图8:

语义宰割概率图和特点调造层参数的联系


现实场景中,物体类此外分隔界限通常并不极度显著,好比图9中的植物和草的区域,它们之间的过渡是“无缝”且陆续的,而本文中使用的语义宰割概率图以及调造层的参数也是陆续变动的。因而,SFT-GAN能够更为精密地调造纹理的天生。


rfbrtn.jpg


图9:

SFT层可能更为精密地调造参数


本文还比力了其他结合先验前提的方式:


  1. 将图像和得到的语义宰割概率图级联起来共同输入;

  2. 通过分歧的分支处置分歧的场景类别,而后利用语义宰割概率图融合起来;

  3. 不思考空间关系的特点调造步骤FiLM。


从图10中能够看到:


步骤1)的了局没有SFT层有效(SFT-GAN模型中有多个SFT层能将先验前提更为缜密地结合);

步骤2)的效能不够高(SFT-GAN只必要进行一次前向运算);

步骤3)由于没有空间地位的关系,导致分歧类别之间的纹理互有关扰。


shtsrj.jpg

图10:

分歧先验前提结合方式的了局比力


结论


本文深刻探求了若何使用语义宰割概率图作为语义先验来约束超分辨率的解空间,使天生的图像纹理更切合真实而天然的纹理个性;固岢隽艘恢中孪实目占涮氐愕髟觳(SFT)来有效地将先验前提结合到现有网络中  ?占涮氐愕髟觳隳芄缓拖钟械某直媛释缡褂猛乃鹗Ш,端到端地进行训练。测试时,整个网络能够接受肆意大幼尺寸的图像作为输入,只必要一次前向传布,就可能输出结合语义类别先验的高分辨率图像。尝试了局显示,相较于现有超分辨率算法,本文SFT-GAN模型天生的图像拥有越发真实天然的纹理。


参考文件


  1. SRGAN: C.Ledig, L.Theis, F.Husz?ar, J.Caballero, A.Cunningham, A.Acosta, A.Aitken, A.Tejani, J.Totz, Z.Wang, et al.Photo-realistic single image super-resolution using a generative adversarial network. In CVPR, 2017.

  2. EnhanceNet: M.S.Sajjadi, B.Scholkopf, and M.Hirsch. EnhanceNet: Single image super-resolution through automated texture synthesis. In ICCV, 2017

  3. FilM: E.Perez, F.Strub, H.de Vries, V.Dumoulin, and A.Courville. FiLM: Visual reasoning with a general conditioning layer. In AAAI 2018.


产品试用
填写此单一表格,我们将尽快联系您!
商务合作
400 900 5986
周一至周五 9:00-12:00,13:00-18:00
合作同伴招募
【网站地图】