「确实会有这种的担忧,所以为了防止它在测试集上出现这种情况,我们引入了一种全新的正则化技术。」
「也就是dropout随机失活。」
「它的原理是,在每一次前向传播中,以50%的概率随机将部分神经元的输出置为零,这些被选中的神经元在这一轮训练中,既不参与前向传播,也不参与反向传播。」
「这相当於每次训练,都在训练一个不同的网络,最後做预测时,等於把无数个网络的意见集合起来,一个神经元摸了鱼,其他神经元就不敢太依赖它,逼着整个网络学到更健壮的特徵。」
「最後一个问题。」
mit的领队现在已经从质疑变成了纯粹的好奇:「如此庞大的训练,常规的cpu集群跑下来,没有几个月根本不可能,你们是用了什麽超算?哪个国家实验室赞助的?」
所有人都以为,漆昊背後一定站着某个庞大的机构。
漆昊直接回答:「其实没有用超算。」
「当时我只是想测试我的想法是否可行,所以就用了两块gtx580。」
「两块gtx580?」mit教授不敢相信自己听到的信息,「打游戏的那种?」
台下顿时响起了一片倒吸凉气的声音。
用显卡?
用打游戏娱乐的显卡,去跑世界上规模最大的图像识别挑战赛?
「我花了一点时间,用cuda重写了卷积和池化的计算核,并且设计了一套双卡并行架构。」
「因为3gb显存依然装不下整张网络,我们将qinet的神经元分别寄存在两张显卡上,它们只在特定的层,比如第三层卷积和全连接层进行数据通信,而在其他层,两张显卡各自独立计算,互不干扰。」
佩罗宁原本以为对方是靠着什麽漏洞或者运气,但现在,漆昊一步步讲解,一切又觉得十分合理。
佩罗宁主导设计的费舍尔向量算法,在图像分类领域几乎打遍天下无敌手,是全行业公认的最优解。
为了更好训练整个模型,他们甚至为此向总部申请了数十万欧元的预算,租用了欧洲最顶级的超算集群,夜以继日地进行着复杂的矩阵计算。
结果现在漆昊的方案,告诉他,他们连研究方向都选错了!
真是难以置信!
作为老牌cv学者的尊严让他不得不最後挣紮一下。