全文共5786字,預計學習時長17分鐘
全文共5786字,預計學習時長17分鐘
圖源:Unsplash
你能想象嗎?也許在屏幕對面和你視頻聊天的美女不是“人”。
啊,她也不是“機器人”,更不是“妖魔鬼怪”。
可能她只是一堆數(shù)據(jù)構成的“假人”……
看看下面這位美女。她看起來很美很有親和力。也許你會在linkedin或者WeChat上和她聯(lián)系,或者雇傭她來經(jīng)營社交媒體。如果在孩子的體操課上見到她,你會打個招呼,寒暄幾句。根據(jù)你的說服力,如果有機會,甚至可以在她的Tinder或微博個人資料頁上向右滑動查看。
制作人員:這個人并不存在。/生成式對抗網(wǎng)絡 風格
唯一的問題就是:她不存在,上面的圖像是由一種名為“生成式對抗網(wǎng)絡(GAN)”的新型機器學習技術生成的。該技術于2014年出現(xiàn),在普及度和可能性上都呈現(xiàn)出爆炸式增長。圖靈獎獲得者Yann LeCun將該技術描述為“過去20年來機器學習中最酷的想法”。這項技術用于視頻游戲、天文學和藝術,并席卷了媒體和法律界。
幕后的生成式對抗網(wǎng)絡
生成式對抗網(wǎng)絡的工作原理是:使用兩個深度學習神經(jīng)網(wǎng)絡,讓其在小型戰(zhàn)斗中相互競爭。第一個是生成網(wǎng)絡,通常是一個卷積神經(jīng)網(wǎng)絡,在一組樣本圖像上進行訓練。像所有卷積神經(jīng)網(wǎng)絡(CNN)一樣,生成式對抗網(wǎng)絡可以學習訓練集的屬性和模式,并能夠從頭開始生成相似的圖像。
第二個是判別網(wǎng)絡,它也用原始數(shù)據(jù)進行訓練,旨在評估一張?zhí)囟▓D像是否遵循原始數(shù)據(jù)集的統(tǒng)計分布。簡而言之,當給定一張新圖像時,判定網(wǎng)絡可以推測該圖像是否屬于原始圖像集。
這就讓事情變得很有趣。生成式對抗網(wǎng)絡并沒有讓各個網(wǎng)絡靜靜地嗡嗡作響,而是讓這些網(wǎng)絡相互對抗。生成式對抗網(wǎng)絡的目標是創(chuàng)建足以欺騙判別網(wǎng)絡的偽造圖像。判別網(wǎng)絡的目標是避免受到欺騙,準確地猜測出哪些是假圖像,哪些是原始數(shù)據(jù)。
生成網(wǎng)絡一遍又一遍地生成新圖像,而判別網(wǎng)絡則對其進行評估。然后,兩個網(wǎng)絡會檢查自己的工作,看看哪個網(wǎng)絡贏得了每一輪比賽。當兩個網(wǎng)絡相互爭斗數(shù)千次后,都會使用反向傳播從錯誤和成功中學習。生成網(wǎng)絡更擅長生成逼真的假圖像,而判別網(wǎng)絡則更擅長去區(qū)分這些圖像。隨著時間的推移,兩個網(wǎng)絡通過相互競爭而不斷得到完善。該技術利用并行計算的最新進展來快速訓練網(wǎng)絡,NVIDIA和其他GPU公司最早使用這種技術。
GPU技術上的進步如像NVIDIA這樣的顯卡,使得生成式對抗網(wǎng)絡成為可能。制作人員:Gado圖片。
常規(guī)訓練結束時,生成網(wǎng)絡已非常擅長生成逼真的假圖像了。生成網(wǎng)絡依靠自己的力量運行,雖然對手判別網(wǎng)絡有了很大改進,但現(xiàn)在生成網(wǎng)絡能生成足以欺騙人類的假圖像。
這很像棒球運動員在接棒球之前揮舞著重重的球棒,或者一名大學生正在使用比預期考試難度更大的問題來學習。通過訓練每次比賽中表現(xiàn)越來越好的狡猾對手,生成網(wǎng)絡可以不斷提高游戲水平。當強大的對手離開,轉而欺騙普通人時,這項任務變得相對容易。
生成式對抗網(wǎng)絡會帶來問題
不足為奇的是,可以生成逼真假人的人工智能系統(tǒng)引起了軒然大波,這種系統(tǒng)遠遠超出了深度學習的領域。在媒體領域,生成式對抗網(wǎng)絡會對可信度造成威脅。生成式對抗網(wǎng)絡很自然地與“深度造假”相關聯(lián),深度造假中的神經(jīng)網(wǎng)絡能模擬真實的人,創(chuàng)建一些人們似乎從未說過或做過的視頻或圖片。
當然,人們能夠用Photoshop把名人或政客P到從未參加過的活動中,或展示他們和從未見過面的人握手。但要創(chuàng)建一個真實的視頻:名人政客似乎發(fā)表著種族主義言論或說出會煽動所在政黨的聲音,這樣的能力更加困難,并且通常要借助生成式對抗網(wǎng)絡。
這對新聞媒體的生存是一大威脅,新聞內(nèi)容的(假冒新聞除外)可信度至關重要。如何得知舉報人提供的隱藏視頻片段是真實的,還是生成式對抗網(wǎng)絡精心制作的虛假內(nèi)容以故意破壞對手名聲呢?
還有更黑暗和棘手的問題。啟用生成式對抗網(wǎng)絡的色情圖像已出現(xiàn)在互聯(lián)網(wǎng)上,通常使用真實名人的面孔。這個問題可能會進一步擴大。名人很容易標記,因為互聯(lián)網(wǎng)上已經(jīng)有很多相關的照片,公眾對名人的個人生活也是興趣高漲。這就讓找到生成式對抗網(wǎng)絡的訓練數(shù)據(jù)相對容易,而且發(fā)布虛假視頻或照片也變得有利可圖。但是隨著技術的進步和所需訓練集規(guī)模的縮小,黑客可能會偽造幾乎任何人的X級剪輯視頻片段,利用這些片段進行敲詐或勒索。還記得之前那個爆火的軟件ZAO嗎?
圖源:Unsplash
誰擁有這些偽造的人?
除了這些生存威脅和令人驚悚的風險外,即使出于積極原因而建立的生成式對抗網(wǎng)絡也會帶來一些棘手的法律問題。一個關鍵問題是:誰真正擁有生成式對抗網(wǎng)絡帶來的圖像權。
美國版權法非常明確地規(guī)定,受版權保護的作品必須要有一個人類作者。但這個基本前提面臨著多方面的轟動性挑戰(zhàn),比如自動攝像機拍攝的監(jiān)控錄像的所有權案,以及臭名昭著的猴子自拍案,PETA聲稱一只鳳頭獼猴擁有用攝影師相機拍攝的圖片權。
機器創(chuàng)建的圖像版權很復雜,例如監(jiān)控攝像機的錄像。制作人員:Gado圖片。
如果某作品需要人類作者才能獲得版權保護,那么是否有人擁有生成式對抗網(wǎng)絡制作的圖像版權呢?畢竟,這些圖像不是人拿著相機拍攝的,而是兩個對抗的計算機程序相互競爭帶來的結果。這是一個棘手的問題,但慶幸的是,其他領域有這樣的先例,下面會一一進行介紹。
除了所有權,人在使用生成式對抗網(wǎng)絡時有什么限制呢?可以使用生成式對抗網(wǎng)絡偽造任何人嗎?
人類會做出反擊
面對生成式對抗網(wǎng)絡的威脅,許多組織和立法者已經(jīng)作出回應。代表演員和藝人利益的美國電影演員協(xié)會(SAG)正在積極游說呼吁立法,防止制片公司用生成式對抗網(wǎng)絡全息圖代替真實的演員。
這一做法很有必要,如果可以創(chuàng)建虛假又逼真的布拉德·皮特(Brad Pitt)讓他參加競標,那為什么還要去雇用真正的布拉德·皮特呢?生成式對抗網(wǎng)絡創(chuàng)建出的布拉德不需要休息,不會忘記臺詞,也不太可能要求七位數(shù)的薪水。但是,對于去世的演員來說,事情變得更加復雜。美國電影演員協(xié)會希望終止生成名人圖像的權利,但這與《第一修正案》中的一些挑戰(zhàn)性議題相抵觸。
美國已經(jīng)有好幾個州參與到了這場爭論中。2019年10月3日,加利福尼亞州通過了法案AB-602,該法案規(guī)定,禁止在選舉60天內(nèi)使用生成式對抗網(wǎng)絡制作虛假色情作品或政客的剪輯視頻。紐約正在考慮通過公開權制定生成式對抗網(wǎng)絡的法規(guī)。
用于好的方面的生成式對抗網(wǎng)絡
對生成式對抗網(wǎng)絡進行監(jiān)管非常必要。當然,以合成色情圖像或其他剝削性內(nèi)容為例,立法者介入或清除品行不端的演員很有意義。
但是,也存在過度監(jiān)管生成式對抗網(wǎng)絡的風險。當用于好的方面時,生成式對抗網(wǎng)絡可以是一種有著大量潛在好處的強大技術。
例如,以建立生成式對抗網(wǎng)絡的初心為例。最初開發(fā)該技術并不是出于生成令人信服的假人圖像的目的,而是為了生成用于訓練其他深度學習系統(tǒng)的大數(shù)據(jù)集。
通常,在機器學習中,很難找到優(yōu)質(zhì)的數(shù)據(jù)。尤其是在使用新穎的網(wǎng)絡和技術的情況下,數(shù)據(jù)科學家需要大量圖像訓練新型的視覺人工智能系統(tǒng),有時需要一百萬個圖像甚至更多圖像。購買所有的這些圖像非常昂貴,特別對于科學家個人或研究小組而言。
甚至購買基本訓練的圖像版權也十分昂貴,例如在真實環(huán)境中描繪真實人物。制作人員:Gado圖片。
生成式對抗網(wǎng)絡就是為了解決這一問題。例如,有了生成式對抗網(wǎng)絡后,正在建立新型面部識別系統(tǒng)的研究科學家無需再去購買數(shù)百萬張人臉圖像。相反,他們可以一次訓練一個生成式對抗網(wǎng)絡,然后使用這個網(wǎng)絡生成所需要的盡可能多的假臉圖像,并在這些圖像上訓練新系統(tǒng)。
生成式對抗網(wǎng)絡主要用于此目的。但這仍不是一個完美的解決方案,IBM的一位同事表示,這個過程類似于影印一張影印圖像而不是影印原始文檔,并且存在相同的失真和質(zhì)量損失,但生成式對抗網(wǎng)絡仍然是數(shù)據(jù)科學家的重要工具。
在實際訓練數(shù)據(jù)有限的情況下,生成式對抗網(wǎng)絡仍是至關重要的。他們提出,例如,生對抗網(wǎng)絡作為部分解決方案,可解決缺少除高加索男性以外的面部訓練圖像這一問題,從而增加深度學習系統(tǒng)的多樣性。還可以在ThisPersonDoesNotExist上對自己生成的假人進行試驗。
除了機器學習,生成式對抗網(wǎng)絡還具有各種各樣的實際用途。在股票、攝影和時尚領域,生成式對抗網(wǎng)絡可生成逼真的肖像而無需雇傭模特或租用場地。這使攝影師或設計師(尤其是剛起步的人)在沒有前期投入的情況下更容易實現(xiàn)某一概念或展示新衣服。
在其他領域,生成式對抗網(wǎng)絡可用于任何有視覺圖案的地方。生成式對抗網(wǎng)絡可以為天文學中的暗物質(zhì)建模,從2D照片中創(chuàng)建物體的3D模型,為電子游戲創(chuàng)建虛假房間或空間,呈現(xiàn)人的衰老過程,甚至為癌癥研究中的新分子或蛋白質(zhì)提供一些想法。
前進中的生成式對抗網(wǎng)絡
未來,生成式對抗網(wǎng)絡將變得更加強大。
目前,在視覺領域,生成式對抗網(wǎng)絡主要限于生成相對有界限的、高度圖案化的圖像,這其中有大量訓練數(shù)據(jù)可供使用。人臉就是一個很好的例子-人臉因人而異,但具有許多相同的基本屬性。全世界有超過60億的人,可供生成式對抗網(wǎng)絡學習的地方還有很多(同樣地,假設生成式對抗網(wǎng)絡的創(chuàng)建者有足夠資源購買大型的數(shù)據(jù)集)。
但是,隨著技術的進步,這些障礙將變得不那么重要。人們普遍認為,在接下來的3-5年中,生成式對抗網(wǎng)絡將會發(fā)展到足以從頭開始創(chuàng)建全新的場景,而不僅僅是臉部特寫。例如,設計師可能會說:“我想拍攝一位女性,她走下樓梯,扶著欄桿,抬頭看著她的肩膀”,而生成式對抗網(wǎng)絡則可以創(chuàng)建出像照片一樣真實的照片。
對于未來的這種誘人的設想早已存在。名為Stack的一種生成式對抗網(wǎng)絡已經(jīng)可以對單個對象執(zhí)行這類操作,并根據(jù)外觀的文字描述生成假鳥的圖片。另一種生成式對抗網(wǎng)絡可以通過塊狀的汽車、人等地圖來生成形象的(即使不夠完美)街道場景。
這種生成式對抗網(wǎng)絡可以通過一組視覺指令生成半逼真的街道場景。制作人員:Ting-ChunWang 等人
顯然,隨著這些技術的進步,可以取代大部分的攝影、電影制作、室內(nèi)設計或其他依賴視覺媒體的制作。
這些行業(yè)中的員工是應該立即尋找新工作,還是冒著被生成式對抗網(wǎng)絡取代的風險?所有的視覺藝術都會被機器取代嗎?
回到未來
在進入全面恐慌模式之前,需要停下來片刻,回想一下這個領域早已存在類似生成式對抗網(wǎng)絡的相同屬性和最終產(chǎn)品。
在這個領域中,有些人會沉浸于他們記憶中的數(shù)百萬人、地點或物體。他們接受了廣泛的培訓,這些人有時是一些苛刻或狡猾的評論家。
在某些情況下,這些評論家也會采用所需場景或概念的文字描述。然后,他們選擇一些工具,并使用這些工具來創(chuàng)建一個全新的圖像。該圖像可能會在新情況下呈現(xiàn)一個已知人物,或者可能在實際不存在的場景中呈現(xiàn)出一個想象中的人物。該領域被稱為“插圖”。
插畫家、動畫師和CGI藝術家通常會執(zhí)行與生成式對抗網(wǎng)絡相同的任務——他們的全部工作就是想象新的場景、人物和地點并把他們呈現(xiàn)在頁面或屏幕上。在許多情況下,他們的創(chuàng)作都是如照片般逼真,尤其是在當CGI創(chuàng)作通常與真實的地方或真實的演員無法區(qū)分時。
生成式對抗網(wǎng)絡可看作是一種說明工具,而不是某個新的威脅,因此生成式對抗網(wǎng)絡并沒有那么嚇人。當然,生成式對抗網(wǎng)絡使得創(chuàng)建逼真的插圖更加容易,也更加逼真(這取決于插畫家或動畫師的技能)。但最后,生成式對抗網(wǎng)絡并沒有做任何新的事情;只是將“深度學習”應用于一種古老的藝術概念,這種概念可以追溯到最早人類開始在洞穴墻壁上畫水牛。
把生成式對抗網(wǎng)絡視為插圖工具也解決了許多有關網(wǎng)絡的法律問題。法院一直裁定CGI創(chuàng)作的作品符合版權保護的條件,因為這些作品是通過人工操作員的通過創(chuàng)造性的選擇制作而成。
而且,CGI工具也不總是確定的-要么從人類那里獲得指令后,然后在關鍵幀之間“填充”動作,要么創(chuàng)建設計師未直接建模的新穎序列。沒有人會說動畫師創(chuàng)作的電影得不到版權保護,只是因為After Effects填補了關鍵幀之間的某些動作,或者為線框增加了紋理和光照。至關重要的是動畫師的創(chuàng)意以及如何生成最終產(chǎn)品。
圖源:Unsplash
生成式對抗網(wǎng)絡存在于類似的空間中。生成式對抗網(wǎng)絡可以想象新的場景,但需要生成有用的輸出,并且仍然需要人類指導如何創(chuàng)建。即使生成式對抗網(wǎng)絡可以隨機生成人臉,仍然需要人類的投入和指導來決定哪些人臉可信,哪些適合特定的創(chuàng)意項目等。提供指導本身就是一項創(chuàng)造性的工作,因此應該要有版權。生成式對抗網(wǎng)絡的結果并不完美-在許多情況下,仍需要人類的幫助才能產(chǎn)生可用的結果。
比如,看看本文最開始的那個人。乍一看,這個女人看上去很真實,但湊近看一看。她的耳朵怎么了?那是耳環(huán)嗎?有污垢嗎?這張基本的圖像看上去不錯,但這得益于熟練(中等程度)的人工操作員進行了清理和調(diào)整。所有這些調(diào)整和選擇都是富有創(chuàng)造力的行為,可以把生成式對抗網(wǎng)絡的原始輸出變成有用且令人信服的插圖。
生成式對抗網(wǎng)絡的輸出仍然需要人工選擇和編輯。制作人員:ThisPersonDoesNotExist / Style生成式對抗網(wǎng)絡,由GadoImages編輯
從這里來,要往哪里去?
生成式對抗網(wǎng)絡提出了一些社會應該繼續(xù)思考和探索的重大問題。利用這些技術進行深度偽造和露骨的內(nèi)容制造會令人不安,引發(fā)社會騷動,監(jiān)管機構應該盡早解決此類問題。
但是,與此同時,社會在監(jiān)管插手這些新技術時應謹慎對待,避免扼殺這些技術的積極應用。盡管生成式對抗網(wǎng)絡的輸出可能令人恐懼甚至毛骨悚然,但它有潛力革新許多視覺藝術,讓時裝和攝影更具包容性,促進藥物的發(fā)明,以及解決各種想象不到的問題?,F(xiàn)有的插圖領域提供了一個法律和道德框架,可以開始解決有關生成式對抗網(wǎng)絡及其影響的問題。
在這個社會上,我們需要承認偽造人像的威脅,但也要接受帶來的好處。在他們微笑的面孔后是生成式對抗網(wǎng)絡技術的成熟與靈活運用,也是未來社會發(fā)展與進步不可抵擋的重要力量源泉之一。
留言 點贊 關注
我們一起分享AI學習與發(fā)展的干貨
如需轉載,請后臺留言,遵守轉載規(guī)范


