來(lái)源:openai
編輯:向?qū)W
【新智元導(dǎo)讀】哈佛大學(xué)與OpenAI的研究者最新發(fā)現(xiàn)“雙下降現(xiàn)象”:隨著模型大小、數(shù)據(jù)大小或訓(xùn)練時(shí)間的增加,性能先提高,接著變差,然后再提高。這可能會(huì)導(dǎo)致“Bigger models may be worse, more samples maybe hurts”。雖然這種行為似乎相當(dāng)普遍,但我們尚未完全了解其發(fā)生的原因,因此這是一個(gè)值得進(jìn)一步研究的重要研究方向。你怎么看?現(xiàn)在戳右邊鏈接上 新智元小程序 了解更多!
近日,哈佛大學(xué)Preetum Nakkiran等研究者與人工智能研究組織OpenAI的研究者Ilya Sutskever最新研究發(fā)現(xiàn),包括卷積神經(jīng)網(wǎng)絡(luò)(Convolutional Neural Networks,CNNs)、殘差網(wǎng)絡(luò)(Residual Networks,ResNets)與Transformers的許多現(xiàn)代深度學(xué)習(xí)模型均會(huì)出現(xiàn)“雙下降現(xiàn)象”(Double Descent Phenomenon):隨著模型大小、數(shù)據(jù)大小或訓(xùn)練時(shí)間的增加,性能先提高,接著變差,然后再提高。其峰值出現(xiàn)在一個(gè)“臨界區(qū)”,即當(dāng)模型幾乎無(wú)法擬合訓(xùn)練集時(shí)。當(dāng)增加神經(jīng)網(wǎng)絡(luò)中的參數(shù)數(shù)目時(shí),測(cè)試誤差最初會(huì)減小、增大,而當(dāng)模型能夠擬合訓(xùn)練集時(shí)測(cè)試誤差會(huì)經(jīng)歷第二次下降。這種效果通常可以通過(guò)仔細(xì)的正則化來(lái)避免。雖然這種行為似乎相當(dāng)普遍,但我們尚未完全了解其發(fā)生的原因,因此這是一個(gè)值得進(jìn)一步研究的重要研究方向。
論文地址:https://arxiv.org/pdf/1912.02292.pdf
這既不同于古典統(tǒng)計(jì)學(xué)家認(rèn)為太大的模型更差的傳統(tǒng)觀點(diǎn),也不同于現(xiàn)代機(jī)器學(xué)習(xí)認(rèn)為更大模型會(huì)更好的范式;且“雙下降現(xiàn)象”也發(fā)生于訓(xùn)練的epoch增加時(shí)。
訓(xùn)練和測(cè)試誤差是模型大小的函數(shù)
“雙下降現(xiàn)象”可能會(huì)導(dǎo)致產(chǎn)生“training on more data hurts”的區(qū)域。上圖中測(cè)試誤差的峰值出現(xiàn)在插值閾值附近,而此時(shí)模型的大小剛好不足以擬合訓(xùn)練集。在該研究觀察到的所有情況下,影響插值閾值的變化(如改變優(yōu)化算法、訓(xùn)練樣本數(shù)或標(biāo)簽噪聲量)也相應(yīng)地影響測(cè)試誤差峰值的位置。“雙下降現(xiàn)象”在添加標(biāo)簽噪聲的設(shè)置中最為突出;如果沒(méi)有標(biāo)簽噪聲,那么峰值較小因此容易丟失;而添加標(biāo)簽噪聲則會(huì)放大這種一般行為,并使我們能夠輕松地進(jìn)行調(diào)查。
測(cè)試損失是Transformer模型大小的函數(shù)
“樣本非單調(diào)性”可能會(huì)導(dǎo)致產(chǎn)生“more samples hurts”的區(qū)域。上圖為在沒(méi)有添加標(biāo)簽噪聲時(shí)接受語(yǔ)言翻譯任務(wù)訓(xùn)練的Transformer。正如預(yù)期的那樣,在增加樣本數(shù)時(shí)會(huì)使曲線向下移動(dòng),以降低測(cè)試誤差;然而,由于更多樣本需要更大模型來(lái)擬合,因此增加樣本數(shù)也會(huì)使插值閾值(與測(cè)試誤差的峰值)向右移動(dòng)。對(duì)于中等大小的模型(紅色箭頭標(biāo)識(shí)),這兩種效果的結(jié)合使在4.5倍以上的樣本上進(jìn)行的訓(xùn)練實(shí)際上會(huì)降低測(cè)試性能。
測(cè)試誤差、訓(xùn)練誤差是模型大小與訓(xùn)練epoch的函數(shù)
測(cè)試誤差與訓(xùn)練誤差既是模型大小的函數(shù),也是訓(xùn)練epoch的函數(shù)。在上圖中,對(duì)于給定數(shù)量的優(yōu)化步驟(固定y坐標(biāo)),測(cè)試誤差和訓(xùn)練誤差表現(xiàn)為模型大小的“雙下降”;對(duì)于給定的模型大小(固定x坐標(biāo)),隨著訓(xùn)練的進(jìn)行,測(cè)試誤差和訓(xùn)練誤差減小、增加、再次減小。一般來(lái)說(shuō),測(cè)試誤差的峰值系統(tǒng)地出現(xiàn)在當(dāng)模型幾乎不能擬合訓(xùn)練集時(shí)。
參考資料:
https://openai/blog/deep-double-descent/


