- 主题技术
- 以原创技术系统为根基,SenseCore东升国际官网AI大装置为主题基座,布局多领域、多方向前沿钻研,
急剧买通AI在各个垂直场景中的利用,向行业赋能。
IR-Net: 信息保留的二值神经网络
导读:在CVPR 2020上,东升国际官网钻研院链接与编译组和北京航空航天大学刘祥龙教员团队提出了一种旨在优化前后向传布中信息流的实用、高效的网络二值化新算法IR-Net。分歧于以往二值神经网络大多关注量化误差方面,本文初次从统一信息的角度钻研了二值网络的前向和后向传布过程,为网络二值化机造的钻研提供了全新的视角。同时,该工作初次在ARM设备上进行了先进二值化算法效能验证,显示了IR-Net部署时的优异机能和极高的实用性,有助于解决工业界关注的神经网络二值化落地的主题问题。
动机
二值神经网络因其存储量幼、推理效能高而受到社会的宽泛关注 [1]。然而与全精度的对应步骤相比,现有的量化步骤的精度依然存在显著的降落。
对神经网络的钻研批注,网络的多样性是模型达到高机能的关键[2],维持这种多样性的关键是:(1) 网络在前向传布过程中可能携带足够的信息;(2) 反向传布过程中,精确的梯度为网络优化提供了正确的信息。二值神经网络的机能降落重要是由二值化的有限暗示能力和离散性造成的,这导致了前向和反向传布的严沉信息损失,模型的多样性急剧降落。同时,在二值神经网络的训练过程中,离散二值化往往导致梯度不正确和优化方向谬误。若何解决以上问题,得到更高精度的二值神经网络?这一问题被钻研者们宽泛关注,本文的动机在于:通过信息保留的思路,设计更高机能的二值神经网络。
基于以上动机,本文初次从信息流的角度钻研了网络二值化,提出了一种新的信息维持网络(IR-Net):(1)在前向传布中引入了一种称为Libra参数二值化(Libra-PB)的平衡尺度化量化步骤,最大化量化参数的信息熵和最幼化量化误差; (2) 在反向传布当选取误差衰减估计器(EDE)来推算梯度,保障训练起头时的充分更新和训练实现时的精确梯度。
IR-Net提供了一个全新的角度来理解二值神经网络是若何运行的,并且拥有很好的通用性,能够在尺度的网络训练流程中进行优化。作者使用CIFAR-10和ImageNet数据集上的图像分类工作来评估提出的IR-Net,同时借助开源二值化推理库daBNN进行了部署效能验证。
步骤设计
高精度二值神经网络训练的瓶颈重要在于训练过程中严沉的信息损失。前向sign函数和后向梯度逼近所造成的信息损失严沉影响了二值神经网络的精度。为相识决以上问题,本文提出了一种新的信息维持网络(IR-Net)模型,它保留了训练过程中的信息,实现了二值化模型的高精度。

前向传布中的Libra Parameter Binarization(Libra-PB)
在此之前,绝大无数网络二值化步骤试图减幼二值化操作的量化误差。然而,仅通过最幼化量化误差来获得一个优良的二值网络是不够的。因而,Libra-PB设计的关键在于:使用信息熵指标,最大化二值网络前向传布过程中的信息流。
凭据信息熵的界说,在二值网络中,二值参数Qx(x)的熵能够通过以下公式推算:

若是单纯地钻营量化误差最幼化,在极端情况下,量化参数的信息熵甚至能够靠近于零。因而,Libra-PB将量化值的量化误差和二值参数的信息熵同时作为优化指标,界说为:

在伯努利散布如果下,当p=0.5时,量化值的信息熵取最大值。
因而,在Libra-PB通过尺度化和平衡操作获得尺度化平衡权沉
,如图2所示,在Bernoulli散布下,由Libra-PB量化的参数拥有最大的信息熵。有趣的是,对权沉的单一变换也能够极大改善前向过程中激活的信息流。由于此时,各层的二值激活值信息熵同样能够最大化,这意味着特点图中信息能够被保留。
在以往的二值化步骤中,为了使量化误差减幼,险些所有步骤城市引入浮点尺度因子来从数值上逼近原始参数,这无疑将高昂的浮点运算引入其中。在Libra-PB中,为了进一步减幼量化误差,同时预防以往二值化步骤中价值高昂的浮点运算,Libra-PB引入了整数移位标量s,扩大了二值权沉的暗示能力。
因而最终,针对正向传布的Libra参数二值化能够暗示如下:

IR-Net的重要运算操作能够暗示为:


反向传布中的Error Decay Estimator(EDE)
由于二值化的不陆续性,梯度的近似对于反向传布是不成预防的,这种对sign函数的近似带来了两种梯度的信息损失,蕴含截断领域表参数更新能力降落造成的信息损失,和截断领域内近似误差造成的信息损失。为了更好的保留反向传布中由损失函数导出的信息,平衡各训练阶段对于梯度的要求,EDE引入了一种渐进的两阶段近似梯度步骤。
第一阶段:保留反向传布算法的更新能力。将梯度估计函数的导数值维持在靠近1的水平,而后逐步将截断值从一个大的数字降到1。利用这一规定,近似函数从靠近Identity函数演化到Clip函数,从而保障了训练早期的更新能力。
第二阶段:使0左近的参数被更正确地更新。将截断维持为1,并逐步将导数曲线演变到阶梯函数的状态。利用这一规定,近似函数从Clip函数演变到sign函数,从而保障了前向和反向传布的一致性。
各阶段EDE的状态变动如图3(c)所示。通过该设计,EDE减幼了前向二值化函数和后向近似函数之间的差距,同时所有参数都能得到合理的更新。

尝试了局
作者使用了两个基准数据集:CIFAR-10和ImageNet(ILSVRC12)进行了尝试。在两个数据集上的尝试了局批注,IR-Net比现有的最先进步骤更具竞争力。


Deployment Efficiency
为了进一步验证IR-Net在现实移动设备中的部署效能,作者在1.2GHz 64位四核ARM Cortex-A53的Raspberry Pi 3B上进一步实现了IR-Net,并在现实利用中测试了其真实速度。表5显示,IR-Net的推理速度要快得多,模型尺寸也大大减幼,并且IR-Net中的位移操作险些不会带来额表的推理功夫和存储亏损。

传送门
IR-Net代码目前已经开源,欢迎各位同学使用和互换。
论文地址:https://arxiv.org/abs/1909.10788
项目地址:https://github.com/htqin/IR-Net
论文解说:近期将有线上直播的论文解说及专题互换课程,欢迎点击下方“东升国际官网泰坦公开课”课程专题链接进行报名
报名链接:https://jinshuju.net/f/RKOLf9
招聘
东升国际官网钻研院-链接与编译团队致力于通过System+AI技术打造顶尖的深度进建主题引擎?⒌哪P脱盗泛湍P筒渴鸸ぞ吡匆逊务于公司多个主题业务。团队在量化模型的在线/离线出产、部署对齐、加快训练等方向有着明确的技术规划。
团队目前在招聘模型量化方向的系统算法钻研员/实习生,欢迎感兴致的幼同伴投递简历到yufengwei@sensetime.com。
Reference
[1] Rastegari M, Ordonez V, Redmon J, et al. Xnor-net: Imagenet classification using binary convolutional neural networks[C]//ECCV. Springer, Cham, 2016: 525-542.
[2] Xie B, Liang Y, Song L. Diverse neural network learns true target functions[J]. arXiv preprint arXiv:1611.03131, 2016.





返回