「25%我是相信的,15%是什麽情况?」
「11%的绝对差距,这不科学!」
「阿西吧,一定是作弊!他们是不是在黑盒测试集上进行了作弊?对,只有提前拿到斯坦福的测试集去进行有针对性的过拟合,才有可能跑出这种吓人的数据!」刚刚还合十祈祷的首尔国立大学领队,根本不相信屏幕上显示的错误率。
「闭嘴吧,寒国人,imagenet的评测伺服器是斯坦福独立脱机运行的,测试集在开赛前才由李教授的团队亲自导入,你告诉我他们怎麽作弊?用特异功能吗?」一旁的阿姆斯特丹大学领队惊讶之余,也不忘怼他。
「漆、漆昊——」
陈工咽了口唾沫,他感觉自己心脏几乎要跳出嗓子眼了!
「我没看错吧?我们在学校实验室里跑十折交叉验证时,由於那几块gtx580显卡可怜的显存限制和保守估计的数据集偏差,测出来的成绩不错,但那是验证集,和测试集数据不同,怎麽一到斯坦福的官方测试集上,这错误率直接到了15%?!」
漆昊此时也有些错愕。
深度卷积神经网络在cuda的并行算力下,对局部图像特徵的捕捉会表现出非同寻常的优越性,但他没想到,实际错误率比他预估中还低。
此时李教授拿着话筒上台了。
东京大学团队的人立刻大声问道:「李教授,请问漆昊团队是否将训练集和测试集搞错了?」
面对东京大学代表队不服气的质疑,原本有些嘈杂的主报告厅再次安静了下去,大家都在期待李教授这位imagenet:挑战赛发起人会怎麽说。
台上李教授,拿起话筒直接解释了起来:「我非常理解东京大学团队,以及在座诸位此时此刻所感受到的震撼和难以置信,但从imagenet挑战赛的工程逻辑和规则设计来看,你们所质疑的混淆数据集的情况,在物理层面上是绝对不可能发生的。」
「众所周知,为了确保比赛的绝对公平,imagenet将整个数据集严格划分为三个完全独立的部分。」
「第一部分是包含120万张图片和完整标注的训练集,用於给各大团队进行模型训练,第二部分是包含5万张图片的验证集,用於大家在本地调参数,而真正决定结果,用於计算最终成绩的,是包含10万张图片的测试集。」
「简单说一下区别,拿训练集和验证集来说,它们就像是学校发给你们用来复习和模拟考的课後习题和参考答案,不管题面如何,大家手里都有一清二楚的正确答案。」
李教授考虑到现场有很多非专业的观众,尽量找了一个简单的例子:「那10万张测试集的图片,就像是期末考试中的期末考卷。」
「所以大家应该知道了,这10万张期末考卷只有题目,根本没有参考答案,标准答案自始至终都被锁在史丹福大学的离岸评测伺服器里,在这个世界上,除了我们核心评估小组的研究员,没有任何一个参赛团队能够接触到其中一个字节。」
「qiet团队和在座的诸位一样,手里只有那10万张没有任何标注的图,他们必须让自己的模型去预测这些图片里装的到底是什麽,然後将生成的纯文本预测报告上传至我们的伺服器,由我们的系统在後台进行全自动的双盲比对。」
「因此,除非漆昊团队黑进了斯坦福的网络,盗取了这10万张测试集的标准答案去教他们的神经网络做题,否则,根本没有可能把训练集和测试集搞混,更不可能在闭环中进行作弊。」
李教授话音一落,主报告厅里那点不服气的嗡嗡声,顿时小了许多。