亚洲国产成人精品久久_欧美日韩国产综合一区二区_亚洲精品理论电影_色综合久久中文字幕

華人博士一作_自動生成摘要超越BERT!帝國理工&谷歌提出新模型Pegasus

放大字體  縮小字體 發(fā)布日期:2019-12-24  來源:來自互聯(lián)網(wǎng)  作者:來自互聯(lián)網(wǎng)  瀏覽次數(shù):318
導(dǎo)讀

【新智元導(dǎo)讀】谷歌大腦和倫敦帝國理工學(xué)院的研究團(tuán)隊在自動生成文本摘要方面獲得新的突破,他們構(gòu)建了一個名為PEGASUS的系統(tǒng),利用谷歌的Transformer架構(gòu),并結(jié)合了針對文本摘要生成定制的預(yù)訓(xùn)練目…

來源:venturebeat、arXiv

編輯:肖琴

【新智元導(dǎo)讀】谷歌大腦和倫敦帝國理工學(xué)院的研究團(tuán)隊在自動生成文本摘要方面獲得新的突破,他們構(gòu)建了一個名為PEGASUS的系統(tǒng),利用谷歌的Transformer架構(gòu),并結(jié)合了針對文本摘要生成定制的預(yù)訓(xùn)練目標(biāo),在12個摘要任務(wù)中均取得了最先進(jìn)的結(jié)果。戳右邊鏈接上新智元小程序 了解更多!

文本摘要是機器學(xué)習(xí)算法正在改進(jìn)的一項任務(wù),微軟最近發(fā)表的論文“Structured Neural Summarization”證明了這一點。這是個好消息,因為自動文本摘要系統(tǒng)有望減少企業(yè)員工閱讀信息的時間(一項調(diào)查估計人們每天至少花2.6小時閱讀信息。)

不甘示弱,谷歌大腦和倫敦帝國理工學(xué)院的一個團(tuán)隊最近構(gòu)建了一個系統(tǒng)——Pre-training with Extracted Gap-sentences for Abstractive Summarization,簡稱PEGASUS,利用谷歌的Transformer架構(gòu),并結(jié)合了針對文本摘要生成定制的預(yù)訓(xùn)練目標(biāo)。

論文第一作者張敬卿來自帝國理工學(xué)院數(shù)據(jù)科學(xué)院,博士在讀; 張敬卿本科畢業(yè)于清華大學(xué)計算機科學(xué)與技術(shù)系,主要研究興趣包括深度學(xué)習(xí)、數(shù)據(jù)挖掘、時間序列與文本挖掘、多模態(tài)問題與生成模型。

點擊新智元小程序下載論文:

研究人員表示,該系統(tǒng)在12個摘要任務(wù)中均取得了最先進(jìn)的結(jié)果(SOTA),這些任務(wù)涵蓋新聞、科學(xué)、故事、使用說明、電子郵件、專利和立法法案等,并且在低資源摘要方面表現(xiàn)“驚人”, 在只有1000個樣本的6個數(shù)據(jù)集上超過了之前的最好結(jié)果。

Pegasus模型:基于Transformer, 5.68億參數(shù)

正如研究人員指出的那樣,文本摘要旨在根據(jù)輸入文檔生成準(zhǔn)確而簡潔的摘要。生成摘要并不是簡單地復(fù)制輸入里的片段,而是可能產(chǎn)生新的單詞或涵蓋主要信息,并使輸出保持語言流暢。

Transformer是谷歌大腦的研究人員開發(fā)的一種神經(jīng)網(wǎng)絡(luò)架構(gòu)。和其他深度神經(jīng)網(wǎng)絡(luò)一樣,它們包含的功能(神經(jīng)元)被布置在相互連接的層中,這些層傳遞輸入數(shù)據(jù)的信號,并緩慢地調(diào)整每個連接的突觸強度(權(quán)重)——這就是所有AI模型提取特征和學(xué)習(xí)做出預(yù)測的方式。但Transformer的獨特指出在于,每個輸出元素都連接到每個輸入元素,并動態(tài)地計算它們之間的權(quán)重。

該團(tuán)隊設(shè)計了一項訓(xùn)練任務(wù),在該任務(wù)中,文檔中的重要句子被覆蓋(masked)起來。AI必須利用網(wǎng)絡(luò)和新聞文章來填補空白,包括那些包含在研究人員編纂的新語料庫(HugeNews)中的文章。

在實驗中,研究團(tuán)隊選擇了性能最佳的Pegasus模型(有5.68億參數(shù)),分別在從3.5億個網(wǎng)頁爬取的750GB文本的Common Crawl數(shù)據(jù)集,或從新聞網(wǎng)站收集的15億篇文章、總計3.8TB的HugeNews數(shù)據(jù)集上進(jìn)行訓(xùn)練。

結(jié)果證明,Pegasus生成的文本摘要在流暢性和連貫性方面都達(dá)到了很高的語言質(zhì)量,而且它不需要采取額外的對策來減輕不流暢。此外,在只有100篇示例文章的低資源環(huán)境中,Pegasus生成的摘要質(zhì)量可與在20000到200000篇完整的完整數(shù)據(jù)集上訓(xùn)練的模型相媲美。

總結(jié)本研究的貢獻(xiàn):

  • 我們提出了一種新的self-supervised的預(yù)訓(xùn)練目標(biāo),用于摘要總結(jié)、空缺句子生成,以及選擇這些句子的學(xué)習(xí)策略。
  • 我們在廣泛的摘要任務(wù)上評估了所提出的預(yù)訓(xùn)練目標(biāo),并選擇了最佳的模型設(shè)置。我們使用這些設(shè)置來訓(xùn)練一個568M參數(shù)的PEGASUS模型,該模型在所有12個下游數(shù)據(jù)集上超過了SOTA,或與SOTA相當(dāng)。
  • 我們展示了如何在幾乎不受監(jiān)督的情況下,通過微調(diào)PEGASUS模型在多個領(lǐng)域?qū)崿F(xiàn)良好的摘要生成性能,而且僅使用1000個示例就可以在許多任務(wù)上超越以前的SOTA結(jié)果。

預(yù)訓(xùn)練目標(biāo)GSG

在這項工作中,我們提出了一個新的預(yù)訓(xùn)練目標(biāo)GSG(Gap Sentences Generation),但為了進(jìn)行比較,我們也評估了BERT的掩碼語言模型目標(biāo)(masked-language model objective)。

Gap Sentences Generation (GSG)

我們假設(shè),使用更接近下游任務(wù)的預(yù)訓(xùn)練目標(biāo),可以獲得更好更快的微調(diào)性能。考慮到我們打算用于摘要生成,我們提出的預(yù)訓(xùn)練目標(biāo)設(shè)計從輸入文檔生成類似摘要的文本。為了利用大量的文本語料庫進(jìn)行預(yù)訓(xùn)練,我們設(shè)計了一個序列到序列的自監(jiān)督目標(biāo)(self-supervised objective)。

圖1: PEGASUS的基本架構(gòu)是一個標(biāo)準(zhǔn)的Transformer encoder-decode。在這個例子中,GSG和MLM同時作為預(yù)訓(xùn)練目標(biāo)。原始文本有三句話。一個句子被[MASK1]屏蔽,并用作目標(biāo)生成文本(GSG)。其他兩句話仍然保留在輸入中,但是一些詞被[MASK2] (MLM)隨機屏蔽了。

為了更接近摘要,我們選擇對文檔來說重要/主要的句子。由此產(chǎn)生的目標(biāo)既具有經(jīng)驗證明的masking的優(yōu)勢,又預(yù)期了下游任務(wù)的形式。

我們考慮3種主要的策略,用于選擇m個空缺句子(gap sentences),而無需從文檔中替換,文檔記為,由n個句子組成:

Random:均勻地隨機選擇m個句子

Lead:選擇前m個句子。

Principal:根據(jù)重要性選擇得分最高的句子。根據(jù)重要性選擇得分最高的句子。

重要性的計算公式是:

在這個公式中,句子是獨立評分的(Ind),并選擇最好的m。

圖2顯示了一個包含lead、random和principal三種策略的gap句子選擇示例。

圖2

掩碼語言模型(Masked Language Model,MLM)

參考BERT,我們在輸入文本中選擇15%的tokens,所選擇的tokens:(1)80%的時間被mask token替換[MASK2],或(2)10%的時間被隨機token替換,或(3)10%的時間不變。我們應(yīng)用MLM訓(xùn)練Transformer encoder,作為唯一的預(yù)訓(xùn)練目標(biāo)或與GSG一起作為預(yù)訓(xùn)練目標(biāo)。

圖1顯示了將GSG和MLM結(jié)合應(yīng)用到同一個例子中的情況。然而,我們發(fā)現(xiàn)MLM并沒有在大量的預(yù)訓(xùn)練步驟中改善下游任務(wù),因此選擇不將MLM應(yīng)用到最終的PEGASUSLARGE模型。

評估結(jié)果:12大任務(wù)獲得最優(yōu)性能

圖4:PEGASUSbase在C4上預(yù)訓(xùn)練的效果。

圖5:PEGASUSbase在C4 (15% GSR, Ind-Orig)上訓(xùn)練詞匯量的效果。

表1:與之前的SOTA相比,PEGASUSLARGE和PEGASUSbase在所有下游數(shù)據(jù)集上的結(jié)果

表2:PEGASUSLARGE與XSum、CNN/DailyMail和Gigaword上其他預(yù)訓(xùn)練模型的比較。最佳結(jié)果用粗體顯示。

表1和表2顯示了PEGASUSbase和PEGASUSLARGE在下游數(shù)據(jù)集上的性能改進(jìn)。雖然PEGASUSbase在許多數(shù)據(jù)集上都超過了當(dāng)前的SOTA水平,但PEGASUSLARGE在使用HugeNews的所有下游數(shù)據(jù)集上都取得了比當(dāng)前水平更好的結(jié)果,盡管C4在WikiHow上的表現(xiàn)更好。

圖6:PEGASUSLARGE模型對一則CNN/DailyMail文本生成的摘要,它的ROUGE2-F值相對較低,為16,但在文本質(zhì)量上相當(dāng)好,而且事實上也很準(zhǔn)確。

新智元送一份星星的祝愿,讓AI給平安夜帶來更美的希望!On this Christmas Eve, wish you a Merry Christmas.

 
 
免責(zé)聲明
本文為會員免費發(fā)布,僅代表發(fā)布者個人觀點,本站未對其內(nèi)容進(jìn)行核實,請讀者僅做參考,如若文中涉及有違公德、觸犯法律的內(nèi)容,一經(jīng)發(fā)現(xiàn),立即刪除,作者需自行承擔(dān)相應(yīng)責(zé)任。涉及到版權(quán)或其他問題,請及時聯(lián)系我們刪除處理。
 
 
主站蜘蛛池模板: 91精品在线看V| 国产精品美乳一区二区免费| 在线天堂一区av电影| 日韩成人手机在线| 国产精品欧美在线| 国产精品对白刺激久久久| 久久亚洲精品网站| 亚洲日本精品国产第一区| 国产麻豆一区二区三区在线观看| 日韩中文不卡| 国产精品av电影| 国产日韩精品电影| 欧美亚洲国产精品| 日韩欧美精品在线不卡 | 久久久久99精品久久久久| 日韩在线免费视频观看| 亚洲人成网站在线观看播放| 国产日韩欧美另类| 国产日本欧美视频| 91精品视频在线看| av日韩一区二区三区| 国产精品久久久久久久天堂| 久久久中文字幕| 久久久久国产精品熟女影院| 欧美亚洲国产视频小说| 日本一区二区三区视频在线观看| 中文字幕久久综合| 91精品久久久久久久久| 宅男在线精品国产免费观看 | 亚洲国产成人不卡| 91国产丝袜在线放| 啊v视频在线一区二区三区| 精品国产日本| 日本不卡免费高清视频| 天天爱天天做天天操| 日韩中文字幕在线视频播放| 91av在线国产| 色综合久久精品亚洲国产| 欧美亚洲视频在线看网址| 久久视频在线观看免费| 国产日韩欧美中文|