第99章 这是数学!(5k)

作者:无机糖 加入书签推荐本书

「我们复活了那个在学术界几乎快要被扫进历史垃圾堆的技术,人工神经网络,确切地说,是卷积神经网络cnwn。」

「cnn?」佩罗宁皱着眉说。

「杨力昆在90年代搞的那个lenet?」

「那玩意儿不是只能识别手写邮政编码吗?面对imagenet:这种上百万张,上千个分类的复杂现实图片,神经网络那可怜的拟合能力和让人绝望的计算效率,根本就走不通嘛!」

「是的,就是杨力昆先生所提出的lenet,大家都知道深度神经网络有三大难题,梯度消失导致的无法收敛,参数过多导致的严重过拟合,以及惊人的计算量。」

「我设计的qinet一共包含5个卷积层,3个全连接层。」

「首先,是关於梯度消失和收敛速度的问题,传统神经网络喜欢用sigmoid或者tanh

作为激活函数,但这两种函数在输入值较大时,梯度会趋近於零,导致深层网络在反向传播时根本无法更新参数。」

「在座的各位想必都被那种训练了三天三夜,损失函数纹丝不动的痛苦折磨过。」

台下的研究员们不由自主地点头。

这苦他们确实都吃过。

「我们的解决方案其实非常简单,直接弃用了复杂的双曲正切和逻辑函数,采用f()=ma(0,)。」

「我们称之为reiu,也就是修正线性单元。」

「在相同的网络结构下,使用reiu的qinet,其收敛速度比使用tanh的网络快了6倍!

35

然而,外行看热闹,内行看门道,台下的学者研究员们,都听懂了他的意思。

f()=a(0,),这个在数学上几乎可以说是初中水平的单侧仰制函数,竟然能带来6

倍的收敛速度提升?这意味着什麽?

这意味着在大规模工程实践中,计算效率将获得质的飞跃!

「那过拟合呢?」一位m1t的教授追问,「120万张图,8层网络,6000万个参数,参数比的样本还多——我是说,这麽大的模型,你怎麽保证它不是把训练集背下来了?」

这个问题问到了点子上,全场再次安静。

上一页 返回目录 下一页