「我们复活了那个在学术界几乎快要被扫进历史垃圾堆的技术,人工神经网络,确切地说,是卷积神经网络cnwn。」
「cnn?」佩罗宁皱着眉说。
「杨力昆在90年代搞的那个lenet?」
「那玩意儿不是只能识别手写邮政编码吗?面对imagenet:这种上百万张,上千个分类的复杂现实图片,神经网络那可怜的拟合能力和让人绝望的计算效率,根本就走不通嘛!」
「是的,就是杨力昆先生所提出的lenet,大家都知道深度神经网络有三大难题,梯度消失导致的无法收敛,参数过多导致的严重过拟合,以及惊人的计算量。」
「我设计的qinet一共包含5个卷积层,3个全连接层。」
「首先,是关於梯度消失和收敛速度的问题,传统神经网络喜欢用sigmoid或者tanh
作为激活函数,但这两种函数在输入值较大时,梯度会趋近於零,导致深层网络在反向传播时根本无法更新参数。」
「在座的各位想必都被那种训练了三天三夜,损失函数纹丝不动的痛苦折磨过。」
台下的研究员们不由自主地点头。
这苦他们确实都吃过。
「我们的解决方案其实非常简单,直接弃用了复杂的双曲正切和逻辑函数,采用f()=ma(0,)。」
「我们称之为reiu,也就是修正线性单元。」
「在相同的网络结构下,使用reiu的qinet,其收敛速度比使用tanh的网络快了6倍!
35
然而,外行看热闹,内行看门道,台下的学者研究员们,都听懂了他的意思。
f()=a(0,),这个在数学上几乎可以说是初中水平的单侧仰制函数,竟然能带来6
倍的收敛速度提升?这意味着什麽?
这意味着在大规模工程实践中,计算效率将获得质的飞跃!
「那过拟合呢?」一位m1t的教授追问,「120万张图,8层网络,6000万个参数,参数比的样本还多——我是说,这麽大的模型,你怎麽保证它不是把训练集背下来了?」
这个问题问到了点子上,全场再次安静。