機器之心編輯部
想要 GPT-2 生成中文故事,聽聽它對各種主題的看法?你可以試試這個中文預訓練 GPT-2 項目,它開源了預訓練結(jié)果與 Colab Demo 演示,只需要單擊三次,我們就能生成定制的中文故事。
想要 GPT-2 生成中文故事,聽聽它對各種主題的看法?你可以試試這個中文預訓練 GPT-2 項目,它開源了預訓練結(jié)果與 Colab Demo 演示,只需要單擊三次,我們就能生成定制的中文故事。
- 項目地址:https://github/imcaspar/gpt2-ml
- Colab 演示地址:https://colab.research.google/github/imcaspar/gpt2-ml/blob/master/pretrained_model_demo.ipynb
既然昨天才過完雙十一,那么我們先看看這個預訓練模型能生成什么樣的故事。如下是我們給定前提「雙十一」,中文 GPT-2 生成的第一個樣本:
Sample, 1 of 10
雙十一,不只是剁手的節(jié)日,更是買買買的狂歡節(jié)!10 月 13 日,中國小象開啟的全新一年的跨境爆款系列商品雙十一的正式來襲,圍繞電商雙十一的購物理念及戰(zhàn)略重點,阿里巴巴、天貓聯(lián)合打造的潮流趨勢支付,正式登陸雙十一狂歡夜。潮流界、時尚界盛事的參與者,統(tǒng)統(tǒng)化身成為電商促銷的傳播者和領(lǐng)導者,時尚界的人們以身作則,走在時尚前線,年輕時尚女性,正用最新的鮮美,向消費者傳遞快樂與創(chuàng)意。不止雙十一,很多行業(yè)的大事件會在這個季節(jié)火熱登場,不只是女性用戶,還有男性用戶。那么,在這些品牌高調(diào)露面的時刻,我們又該如何大玩不同的新玩法?如何抓住雙十一的流量紅利和品牌曝光點?
Sample, 1 of 10
雙十一,不只是剁手的節(jié)日,更是買買買的狂歡節(jié)!10 月 13 日,中國小象開啟的全新一年的跨境爆款系列商品雙十一的正式來襲,圍繞電商雙十一的購物理念及戰(zhàn)略重點,阿里巴巴、天貓聯(lián)合打造的潮流趨勢支付,正式登陸雙十一狂歡夜。潮流界、時尚界盛事的參與者,統(tǒng)統(tǒng)化身成為電商促銷的傳播者和領(lǐng)導者,時尚界的人們以身作則,走在時尚前線,年輕時尚女性,正用最新的鮮美,向消費者傳遞快樂與創(chuàng)意。不止雙十一,很多行業(yè)的大事件會在這個季節(jié)火熱登場,不只是女性用戶,還有男性用戶。那么,在這些品牌高調(diào)露面的時刻,我們又該如何大玩不同的新玩法?如何抓住雙十一的流量紅利和品牌曝光點?
首先,形式是核心。網(wǎng)購、預售、快遞都是消費者在雙十一這個大戰(zhàn)場上所接觸最多的環(huán)節(jié),而品牌商們喜歡的是大玩點創(chuàng)新、玩點新意。其次,先有用戶的需求,才能夠靠作品的特色獲得市場的重視。小象電商的用戶就是普通人,所以他們的需求就是需要一個包包,一條圍巾,要么想各種創(chuàng)意。
首先,形式是核心。網(wǎng)購、預售、快遞都是消費者在雙十一這個大戰(zhàn)場上所接觸最多的環(huán)節(jié),而品牌商們喜歡的是大玩點創(chuàng)新、玩點新意。其次,先有用戶的需求,才能夠靠作品的特色獲得市場的重視。小象電商的用戶就是普通人,所以他們的需求就是需要一個包包,一條圍巾,要么想各種創(chuàng)意。
于是,除了顏值,就是線下,大玩奇思妙想!不限于明星、時尚青年的價值需求,一個玩法就是無限加價,為了讓所有用戶都有收獲。潮流的故事往往是顛覆性的,為了引起用戶的興趣,新玩法的推出,要給用戶充滿驚喜的體驗,提供最奇妙的玩法。就算是普通人購物體驗也會選擇最少的購物過程,這就是品牌持續(xù)+創(chuàng)新的理念。來源:綜合自阿里巴巴官方微博、阿里媽媽官方微博、中國經(jīng)濟網(wǎng)的特點。對阿里和時尚感興趣的朋友,可以關(guān)注微信號:hzcyhg
于是,除了顏值,就是線下,大玩奇思妙想!不限于明星、時尚青年的價值需求,一個玩法就是無限加價,為了讓所有用戶都有收獲。潮流的故事往往是顛覆性的,為了引起用戶的興趣,新玩法的推出,要給用戶充滿驚喜的體驗,提供最奇妙的玩法。就算是普通人購物體驗也會選擇最少的購物過程,這就是品牌持續(xù)+創(chuàng)新的理念。來源:綜合自阿里巴巴官方微博、阿里媽媽官方微博、中國經(jīng)濟網(wǎng)的特點。對阿里和時尚感興趣的朋友,可以關(guān)注微信號:hzcyhg
這個生成樣本說得頭頭是道,很難看出來它完全是由模型生成的,甚至樣本給出了一個微信號,我們查了后估計該微信號與文本是沒什么關(guān)系的。
既然樣本效果這么好,它肯定需要很多中文語料。項目表明,該 15 億參數(shù)量的 GPT-2 中文預訓練模型在 15GB 的純文本上進行訓練,一共迭代了 10 萬步。這 15GB 的純文本主要選自 THUCNews 與 nlp_chinese_corpus,它們會做一系列的數(shù)據(jù)清理。
- THUCNews:thuctc.thunlp.org/#中文文本分類數(shù)據(jù)集THUCNews
- nlp_chinese_corpus:https://github/brightmart/nlp_chinese_corpus
此外,項目作者還簡化整理了 GPT-2 訓練代碼,移植了 Bert Tokenizer 以添加多語言支持。因為移植了 Bert Tokenizer,所以模型輸出結(jié)果很容易與基于 BERT 的模型進行整合。
項目作者開放的預訓練模型是在 TPU Pod v3-256 上復現(xiàn)的 15 億參數(shù) GPT2,這也是 GitHub 上第一個支持大規(guī)模 TPU 訓練的中文 GPT-2 項目。
- 本項目的訓練腳本:https://github/imcaspar/gpt2-ml/tree/master/train
極簡易用的 Colab 演示
非常吸引人的是,該項目提供了一個非常容易使用的 Colab 項目,只需簡單地單擊三次,我們就能使用 Colab 體驗 GPT-2 續(xù)寫整段文本的能力。演示地址在文章前面已經(jīng)提供了,這里主要展示機器之心嘗試的效果。
下圖是我們嘗試使用的結(jié)果,簡單而言分可以為三步:首先從 GitHub 下載源代碼;其次從 Google Drive 下載預訓練模型,這里需要獲得授權(quán),也非常簡單;最后,調(diào)用 Colab 的硬件進行推斷就行了。
我們可以看到,中文 GPT-2 大部分生成結(jié)果,上下文還是非常合理的。如果你也想試一試效果,那就快來試一試吧,沒有任何 ML 基礎(chǔ)也能看到模型的真實效果。


