亚洲国产成人精品久久_欧美日韩国产综合一区二区_亚洲精品理论电影_色综合久久中文字幕

深度學(xué)習(xí)模型陷阱_哈佛大學(xué)與OpenAI首次發(fā)現(xiàn)“雙下降現(xiàn)象”

放大字體  縮小字體 發(fā)布日期:2019-12-09  來(lái)源:來(lái)自互聯(lián)網(wǎng)  作者:來(lái)自互聯(lián)網(wǎng)  瀏覽次數(shù):1018
導(dǎo)讀

正如預(yù)期的那樣,在增加樣本數(shù)時(shí)會(huì)使曲線向下移動(dòng),以降低測(cè)試誤差;然而,由于更多樣本需要更大模型來(lái)擬合,因此增加樣本數(shù)也會(huì)使插值閾值(與測(cè)試誤差的峰值)向右移動(dòng)。對(duì)于中等大小的模型(紅色箭頭標(biāo)識(shí)),這兩種效果的…

來(lái)源:openai

編輯:向?qū)W

【新智元導(dǎo)讀】哈佛大學(xué)與OpenAI的研究者最新發(fā)現(xiàn)“雙下降現(xiàn)象”:隨著模型大小、數(shù)據(jù)大小或訓(xùn)練時(shí)間的增加,性能先提高,接著變差,然后再提高。這可能會(huì)導(dǎo)致“Bigger models may be worse, more samples maybe hurts”。雖然這種行為似乎相當(dāng)普遍,但我們尚未完全了解其發(fā)生的原因,因此這是一個(gè)值得進(jìn)一步研究的重要研究方向。你怎么看?現(xiàn)在戳右邊鏈接上 新智元小程序 了解更多!

近日,哈佛大學(xué)Preetum Nakkiran等研究者與人工智能研究組織OpenAI的研究者Ilya Sutskever最新研究發(fā)現(xiàn),包括卷積神經(jīng)網(wǎng)絡(luò)(Convolutional Neural Networks,CNNs)、殘差網(wǎng)絡(luò)(Residual Networks,ResNets)與Transformers的許多現(xiàn)代深度學(xué)習(xí)模型均會(huì)出現(xiàn)“雙下降現(xiàn)象”(Double Descent Phenomenon):隨著模型大小、數(shù)據(jù)大小或訓(xùn)練時(shí)間的增加,性能先提高,接著變差,然后再提高。其峰值出現(xiàn)在一個(gè)“臨界區(qū)”,即當(dāng)模型幾乎無(wú)法擬合訓(xùn)練集時(shí)。當(dāng)增加神經(jīng)網(wǎng)絡(luò)中的參數(shù)數(shù)目時(shí),測(cè)試誤差最初會(huì)減小、增大,而當(dāng)模型能夠擬合訓(xùn)練集時(shí)測(cè)試誤差會(huì)經(jīng)歷第二次下降。這種效果通常可以通過(guò)仔細(xì)的正則化來(lái)避免。雖然這種行為似乎相當(dāng)普遍,但我們尚未完全了解其發(fā)生的原因,因此這是一個(gè)值得進(jìn)一步研究的重要研究方向。

論文地址:https://arxiv.org/pdf/1912.02292.pdf

這既不同于古典統(tǒng)計(jì)學(xué)家認(rèn)為太大的模型更差的傳統(tǒng)觀點(diǎn),也不同于現(xiàn)代機(jī)器學(xué)習(xí)認(rèn)為更大模型會(huì)更好的范式;且“雙下降現(xiàn)象”也發(fā)生于訓(xùn)練的epoch增加時(shí)。

訓(xùn)練和測(cè)試誤差是模型大小的函數(shù)

“雙下降現(xiàn)象”可能會(huì)導(dǎo)致產(chǎn)生“training on more data hurts”的區(qū)域。上圖中測(cè)試誤差的峰值出現(xiàn)在插值閾值附近,而此時(shí)模型的大小剛好不足以擬合訓(xùn)練集。在該研究觀察到的所有情況下,影響插值閾值的變化(如改變優(yōu)化算法、訓(xùn)練樣本數(shù)或標(biāo)簽噪聲量)也相應(yīng)地影響測(cè)試誤差峰值的位置。“雙下降現(xiàn)象”在添加標(biāo)簽噪聲的設(shè)置中最為突出;如果沒(méi)有標(biāo)簽噪聲,那么峰值較小因此容易丟失;而添加標(biāo)簽噪聲則會(huì)放大這種一般行為,并使我們能夠輕松地進(jìn)行調(diào)查。

測(cè)試損失是Transformer模型大小的函數(shù)

“樣本非單調(diào)性”可能會(huì)導(dǎo)致產(chǎn)生“more samples hurts”的區(qū)域。上圖為在沒(méi)有添加標(biāo)簽噪聲時(shí)接受語(yǔ)言翻譯任務(wù)訓(xùn)練的Transformer。正如預(yù)期的那樣,在增加樣本數(shù)時(shí)會(huì)使曲線向下移動(dòng),以降低測(cè)試誤差;然而,由于更多樣本需要更大模型來(lái)擬合,因此增加樣本數(shù)也會(huì)使插值閾值(與測(cè)試誤差的峰值)向右移動(dòng)。對(duì)于中等大小的模型(紅色箭頭標(biāo)識(shí)),這兩種效果的結(jié)合使在4.5倍以上的樣本上進(jìn)行的訓(xùn)練實(shí)際上會(huì)降低測(cè)試性能。

測(cè)試誤差、訓(xùn)練誤差是模型大小與訓(xùn)練epoch的函數(shù)

測(cè)試誤差與訓(xùn)練誤差既是模型大小的函數(shù),也是訓(xùn)練epoch的函數(shù)。在上圖中,對(duì)于給定數(shù)量的優(yōu)化步驟(固定y坐標(biāo)),測(cè)試誤差和訓(xùn)練誤差表現(xiàn)為模型大小的“雙下降”;對(duì)于給定的模型大小(固定x坐標(biāo)),隨著訓(xùn)練的進(jìn)行,測(cè)試誤差和訓(xùn)練誤差減小、增加、再次減小。一般來(lái)說(shuō),測(cè)試誤差的峰值系統(tǒng)地出現(xiàn)在當(dāng)模型幾乎不能擬合訓(xùn)練集時(shí)。

參考資料:

https://openai/blog/deep-double-descent/

 
 
免責(zé)聲明
本文為會(huì)員免費(fèi)發(fā)布,僅代表發(fā)布者個(gè)人觀點(diǎn),本站未對(duì)其內(nèi)容進(jìn)行核實(shí),請(qǐng)讀者僅做參考,如若文中涉及有違公德、觸犯法律的內(nèi)容,一經(jīng)發(fā)現(xiàn),立即刪除,作者需自行承擔(dān)相應(yīng)責(zé)任。涉及到版權(quán)或其他問(wèn)題,請(qǐng)及時(shí)聯(lián)系我們刪除處理。
 
 
主站蜘蛛池模板: 国产精品第100页| 国产乱子夫妻xx黑人xyx真爽| 日韩精品一区在线视频| 麻豆成人av| 亚洲综合精品一区二区| 国产日韩欧美在线观看| 亚洲中文字幕无码不卡电影| 国产一区二区视频在线观看| 日本精品一区二区三区视频| 日韩av一区二区三区在线观看| 色综合久综合久久综合久鬼88| 99在线国产| 91成人免费观看| 日韩在线三区| 免费中文日韩| 精品一区久久久| 国产伦精品一区二区三区视频免费 | 日韩一区二区三区高清| 伊人色综合久久天天五月婷| 亚洲精品成人久久久998| 日韩在线视频观看| 美女av一区二区三区| 久久精品国亚洲| 国产欧美亚洲精品| 国产高清不卡av| 亚洲精品国产精品久久| 日本久久久a级免费| 久久av免费一区| 国产高清不卡av| 亚洲伊人久久综合| 欧美亚洲国产另类| 国产精品自产拍在线观看中文| 国产精品毛片va一区二区三区| 91国自产精品中文字幕亚洲| 欧洲日本亚洲国产区| 国产亚洲精品自在久久| 97欧美精品一区二区三区| 亚洲五码在线观看视频| 久久五月天综合| 国产精品久久不能| 日韩精品视频在线观看视频 |