这个章节我们看J train 和J CV可能是神恶魔,如何判断是高方差还是高偏差
以语音识别为例
在训练集上的误差是10.8%
在测试机上的误差是14.8%
我们但看10.8%可能会觉得很高,但是我们少考虑了一个问题,就是一个人去做这件事情的话误差是多少,是10.6%,因为存在一些音频有砸噪声存在,一个人都听不清,
所以人和训练集的误差可以说是相当的小了,在可以接受的范围之内
所以当判断训练误差是否高时,建立一个基准性的标准是非常有用的,即
合理的希望学习算法能达到的误差水平是神什么,通常的方法就是测量人类在完成这个任务的表现
另一个是如果有某一种竞争算法,可能是之前某一个人实现的,或者是竞争对手的算法,如果你能测量他就能建立一个基准性水平,或者你有时间根据先前的经验进行猜测。
然后判断算法时候存在高方差或者高偏差,查看基准性能水平,训练误差,和交叉验证误差,
然后要测量两个关键量是,训练误差和你希望达到的基准性能水平之间的差异是什么?
判断是不是高偏差
然后查看训练误差和交叉验证之间的差距,如果差异很大那个得出结论是否是高方差,