來源:venturebeat等
編輯:向?qū)W
【新智元導(dǎo)讀】G ANs是人工智能研究中最為前沿和活躍的領(lǐng)域之一,其強(qiáng)大的特技與廣泛的應(yīng)用使其在全球范圍內(nèi)廣為流傳!那么這風(fēng)靡全球的GANs,其前世、今生、來世又是如何呢?在2020年開年之際,我們來談一談。戳右邊鏈接上新智元小程序 了解更多!
也許您已經(jīng)了解到,當(dāng)前的人工智能已經(jīng)可以生成類似于人類的語音,或者生成難以與真實(shí)照片區(qū)分開的人物圖像,甚至達(dá)到足以“以假亂真”( 假作真時(shí)真亦假,無為有處有還無)的地步!
這些通常就是基于“混世魔王”——生成對(duì)抗網(wǎng)絡(luò)( Generative Adversarial Networks,GANs)而建立的! GANs的演化——“深度學(xué)習(xí)三巨頭”之一Yann LeCun稱其為10年來最有趣的想法——盡管有些漫長和曲折,卻由于強(qiáng)大的生命力而一直延續(xù)至今;盡管也有美中不足之處,卻依舊是當(dāng)今使用的最“多才多藝”的神經(jīng)網(wǎng)絡(luò)架構(gòu)之一。我們且來品讀這風(fēng)靡全球的“混世魔王”的“三生三世”!
前世:大神級(jí)牛人的和風(fēng)化雨,使得GANs出身之時(shí)便不平凡
1959年Arthur Samuel曾經(jīng)這樣定義機(jī)器學(xué)習(xí):“Field of study that gives computers the ability to learn without being explicitly programmed.”(使計(jì)算機(jī)在沒有明確編程的情況下進(jìn)行學(xué)習(xí))。在IBM工作期間,他設(shè)計(jì)了一款 西洋棋游戲——“塞繆爾跳棋游戲”( the Samuel Checkers-Playing Program),這是最早成功自學(xué)的程序之一。
如果Samuel是 GANs的“爺爺 ”,那么前Google Brain研究科學(xué)家(現(xiàn)在蘋果公司任職)Ian Goodfellow可能就是 GANs的“父親”。2014年,Goodfellow及其同事在題為“Generative Adversarial Nets”的研究論文中,描述了基于對(duì)抗網(wǎng)絡(luò)的生成模型的首次實(shí)現(xiàn)。
Ian Goodfellow與“深度學(xué)習(xí)圣經(jīng)”
Goodfellow并非唯一從事對(duì)抗性AI模型設(shè)計(jì)的人。Dalle Molle人工智能研究所負(fù)責(zé)人Juergen Schmidhuber提倡可預(yù)測性最小化(Predictability Minimization),通過編碼器將被預(yù)測器最小化的目標(biāo)函數(shù)(指定系統(tǒng)要解決的問題)最大化,對(duì)分布進(jìn)行建模。
今生:眾多巨子及賢達(dá)助力,使得GANs風(fēng)靡全球,一發(fā)而不可收
觀摩GANs的架構(gòu),方知其中精妙絕倫之處
GANs是由2部分組成:生成樣本的生成器、試圖區(qū)分生成的樣本與真實(shí)樣本的鑒別器。生成器模型從使用分布對(duì)隨機(jī)噪聲的采樣中生成合成示例(如圖像),并將這些示例與來自訓(xùn)練數(shù)據(jù)集的真實(shí)示例一起“喂”給鑒別器,鑒別器試圖在這兩者之間進(jìn)行區(qū)分。生成器和鑒別器的能力都得到提高,直到鑒別器無法從合成示例中分辨出真實(shí)示例的準(zhǔn)確率超過預(yù)期的50%。
這種獨(dú)特的結(jié)構(gòu),使得GANs能夠?qū)崿F(xiàn)令人嘆為觀止的媒體合成特技;但同時(shí)又可能被用于生成有問題的內(nèi)容,如Deepfake可以將人們帶入現(xiàn)有媒體并用其他人的肖像代替自己的!這個(gè)結(jié)構(gòu)巧妙否?!
GANs應(yīng)用場景廣闊而悠遠(yuǎn),“海納百川,有容乃大”
GANs可能是以合成圖像而風(fēng)靡全球的!Nvidia開發(fā)的StyleGAN,通過學(xué)習(xí)面部姿勢、皮膚與頭發(fā)等屬性,生成虛構(gòu)人物的高清頭像。新版本StyleGAN 2在架構(gòu)與訓(xùn)練方法方面均有提高,重新定義了感知品質(zhì)方面的最新水平,生成圖像逼真到嚇人!
使用StyleGAN合成的圖像
2019年6月,Microsoft研究人員詳細(xì)介紹了ObjGAN——一款新穎的GAN,可以理解一段文字說明、生成草圖,并根據(jù)確切描述完善圖像細(xì)節(jié)。
Obj-GAN的實(shí)例
Obj-GAN通過兩個(gè)步驟完成文本到圖像的合成
微軟發(fā)布的另一款StoryGAN,可以實(shí)現(xiàn)“故事可視化”——給定一個(gè)包含多個(gè)句子的段落,通過生成一個(gè)圖像序列(每個(gè)句子對(duì)應(yīng)一個(gè)圖像)來使故事可視化。StoryGAN同樣基于GAN構(gòu)建,但它包含上下文編碼器(可動(dòng)態(tài)跟蹤故事流)與兩個(gè)鑒別器(故事和圖像級(jí)別),以提高生成的序列的質(zhì)量和一致性。
https://microsoft/en-us/research/uploads/prod/2019/06/1812.02784.pdf
創(chuàng)業(yè)公司Vue.ai的GAN通過分析服裝的特征,學(xué)會(huì)了制作逼真的姿勢、膚色和其它特征。從服裝的快照中,它可以生成各種尺寸的模型圖像,比傳統(tǒng)的照片拍攝速度快5倍!
Vue.ai正在引領(lǐng)新的潮流
卡內(nèi)基梅隆大學(xué)(Carnegie Mellon)的科學(xué)家們演繹了 Recycle-GAN,一種數(shù)據(jù)驅(qū)動(dòng)的方法,用于將一個(gè)視頻或照片的內(nèi)容傳輸?shù)搅硪粋€(gè)視頻或照片。在對(duì)人體的鏡頭進(jìn)行訓(xùn)練時(shí), GAN生成的剪輯捕獲了微妙的表情, 如人物微笑和張開嘴巴時(shí)形成的酒窩和線條。
花兒正在綻放
位于首爾的Hyperconnect發(fā)布了MarioNETte,它在保留臉的外貌的同時(shí),合成通過人的動(dòng)作動(dòng)畫制作的重新生成的面孔。
MarioNETte的結(jié)果與基準(zhǔn)的比較
借助GANs這“混世魔王”和新穎數(shù)據(jù)集這股“東風(fēng),現(xiàn)在僅需幾個(gè)視頻幀就能預(yù)測未來的事件——曾經(jīng)被認(rèn)為是不可能完成的任務(wù)!
DeepMind的一篇最新論文詳細(xì)介紹了人工智能剪輯生成這一新興領(lǐng)域的最新進(jìn)展。得益于“計(jì)算效率”的組件和技術(shù),以及一套新的定制數(shù)據(jù)集,他們的最佳性能模型——雙視頻鑒別器GAN (DVD-GAN)——可以生成256 x 256像素、長達(dá)48幀的“高保真”連貫視頻。
https://arxiv.org/pdf/1907.06571.pdf
一組四秒合成視頻剪輯,在Kinetics-600的128×128幀上訓(xùn)練
Cambridge的顧問們演示了一種名為DeepRay的模型,該模型發(fā)明了視頻幀以減輕由于雨水、灰塵、煙霧和其他碎屑而引起的失真。
當(dāng)GANs在合適的數(shù)據(jù)集上訓(xùn)練后,還能創(chuàng)作出新的藝術(shù)作品。印度理工學(xué)院(Indian institute of technology)與薩西薩伊高等學(xué)院(Sri Sathya Sai Institute of Higher Learning)的研究員設(shè)計(jì)了一種稱為SkeGAN的GAN,可以生成基于筆觸的貓、消防車、蚊子和瑜伽姿勢的矢量速寫。
該模型的應(yīng)用實(shí)例
荷蘭馬斯特里赫特大學(xué)(Maastricht University)的科學(xué)家發(fā)明了一種GAN,它可以從12種不同顏色中的一種生成logo。
卡內(nèi)基梅隆大學(xué)畢業(yè)生Victor Dibia訓(xùn)練了一個(gè)GAN來合成非洲部落面具。
愛丁堡大學(xué)(University of Edinburgh)感知研究所和天文學(xué)研究所的一個(gè)團(tuán)隊(duì)設(shè)計(jì)了一個(gè)模型,可以生成與真實(shí)星系的分布密切相關(guān)的虛構(gòu)星系圖像。
Nvidia在GTC(GPU Technology Conference)上揭開了GauGAN的面紗(GauGAN的名字來自后印象派畫家Paul Gauguin),它是一種生成對(duì)抗人工智能生成系統(tǒng),可讓用戶創(chuàng)建栩栩如生的風(fēng)景圖像。
支撐GauGAN的機(jī)器學(xué)習(xí)模型在來自Flickr的100多萬張照片中被訓(xùn)練,讓它對(duì)180多個(gè)對(duì)象的關(guān)系進(jìn)行了深入的了解,包括雪、樹、水、花、灌木、山丘和山脈。
在去年8月的一篇論文中,來自東京國立情報(bào)學(xué)研究所(National Institute of Informatics)的研究員研發(fā)了一個(gè)系統(tǒng),能通過音節(jié)和音符之間的習(xí)得關(guān)系生成“以歌詞為條件”的旋律。
https://arxiv.org/pdf/1908.05551.pdf
去年12月,Amazon Web Services推出了DeepComposer——一款基于云計(jì)算的服務(wù),利用GAN來填補(bǔ)歌曲中的創(chuàng)作空白。
Google和倫敦帝國理工學(xué)院(Imperial College London)的研究員最近著手創(chuàng)建了一個(gè)基于GAN的文本到語音系統(tǒng),能夠達(dá)到(或優(yōu)于)最先進(jìn)的方法。他們提出的系統(tǒng)GAN-TTS由一個(gè)神經(jīng)網(wǎng)絡(luò)組成,該網(wǎng)絡(luò)通過訓(xùn)練一個(gè)包含567個(gè)編碼語音、時(shí)長和音調(diào)數(shù)據(jù)的語音語料庫來學(xué)習(xí)產(chǎn)生原始音頻。
來世:問遙遠(yuǎn)未來路,雖漫漫而曲折,但前程光明
GANs的未來會(huì)如何發(fā)展?盡管過去十年的研究已經(jīng)取得了長足進(jìn)步,但現(xiàn)在還尚處于早期階段。
當(dāng)下GANs仍缺少非常細(xì)致的控制,這是一個(gè)巨大的挑戰(zhàn)。由GAN生成的內(nèi)容將越來越難以與真實(shí)內(nèi)容區(qū)分開來;這個(gè)領(lǐng)域未來會(huì)有很大改善,將2014年的圖像生成與今天的圖像進(jìn)行比較,我們都沒想到它的質(zhì)量會(huì)變得那么好。如果按照這種進(jìn)展繼續(xù)下去,GANs將仍然是一個(gè)非常重要的研究項(xiàng)目。
誠然,由于編者水平有限,尚無法將這“混世魔王”的來世一一道盡。如果您有更好的想法或者觀點(diǎn),不妨且來小程序里與我們探討一二,不勝感激!


