大數(shù)據(jù)文摘出品
來源:MIT
編譯:王轉(zhuǎn)轉(zhuǎn)、劉俊寰
在希區(qū)柯克的經(jīng)典懸疑電影《后窗》中,男主因腿部受傷坐臥修養(yǎng),期間只能用望遠(yuǎn)鏡觀察鄰居的生活打發(fā)無聊時間,由此卷入一場兇殺案。
電影中男主的“觀看”被作為重要元素被反復(fù)強(qiáng)調(diào),“觀看”的內(nèi)容則是被窗戶框選出來的部分生活。
有沒有一種透視法,能夠看穿墻壁等遮擋物,再現(xiàn)遮擋物后的人物動作呢,就像…“火眼金睛”?
當(dāng)然這可不是用來窺視別人生活的,透視法的開發(fā)可以帶來很好的社會效益,比如,自動駕駛汽車可以更好地“看到”拐角處,養(yǎng)老中心可以提高居住的安全性,搜救隊可以提高在危險或障礙區(qū)域的導(dǎo)航能力……
這一切需要交給計算機(jī)視覺(computer vision)模型來處理,現(xiàn)在的CV模型已經(jīng)能完成一些看似不可能的任務(wù)了,比如幫助撲滅加利福尼亞的野火、了解復(fù)雜而險惡的道路,甚至可以用影子看到拐角處。
七年前,MIT研究人員就開發(fā)了一個成像系統(tǒng),該系統(tǒng)能以地板、門和墻壁為“鏡子”,“看到”人眼視線之外的場景信息。
系統(tǒng)利用了一種叫做飛秒激光(femtosecond laser)的裝置,這種裝置能發(fā)出非常短的光脈沖,持續(xù)時間以百萬分之一秒為單位。工作時,系統(tǒng)向?qū)γ娴膲Ρ诎l(fā)射激光,光線從墻上反射到室內(nèi),然后反彈重新出現(xiàn),最終擊中一個探測器。該裝置可以每隔幾皮秒,或萬億分之一秒進(jìn)行測量,由此形成一個完整的物體信息。
可以說,這項工作為未來的計算機(jī)視覺發(fā)展開辟了無限的可能。
最近,MIT計算機(jī)科學(xué)與人工智能實驗室(CSAIL)的科學(xué)家重啟了這項工作。與之前不同的是,他們利用的是一種新方法,即通過細(xì)微的陰影和反射重現(xiàn)被遮擋的動作。也就是說,打開攝像機(jī)之后,即使是攝像機(jī)視野之外的物體或動作,也可以進(jìn)行再現(xiàn)。
MIT的研究員們基于視域外的視頻投射在附近物體上的陰影,預(yù)測出視域外的內(nèi)容。上面一行顯示的是研究員使用這種方法重現(xiàn)的視覺元素,下面一行則是原始物體。
通過觀察陰影和幾何圖形之間的相互作用,新的算法可以預(yù)測光在場景中的傳播方式,即“光傳輸”。然后,再利用這種傳播方式從觀察到的陰影中估計被隱藏的內(nèi)容,甚至可以構(gòu)建真人表演的大致輪廓。
雜物如何成為“觀看”的鏡子
該技術(shù)是“被動的”,這意味著對場景沒有激光或其他干預(yù),整個過程需要大約兩個小時的處理時間。研究人員表示,該技術(shù)最終有助于重現(xiàn)視線之外的場景,包括但不限于上述應(yīng)用。
“通過使用非視距成像設(shè)備(例如激光器)可以完成許多任務(wù),但是在我們的方法中,只能使用自然到達(dá)相機(jī)的光線,并嘗試充分利用這些稀缺的信息,”前CSAIL博士后和NVIDIA現(xiàn)任研究科學(xué)家,新技術(shù)的首席研究員Miika Aittala表示, “鑒于神經(jīng)網(wǎng)絡(luò)的最新進(jìn)展,這似乎是一個很好的時機(jī),可以解決在這個領(lǐng)域以前被認(rèn)為是無法解決的一些挑戰(zhàn)。”
為了捕獲這些看不見的信息,團(tuán)隊使用了細(xì)微的間接照明提示,例如被觀察區(qū)域雜亂的陰影和高光。在某種程度上,一堆雜物的行為有點像針孔照相機(jī),類似于在小學(xué)科學(xué)課中可能會制作的東西:它阻擋了一些光線,但允許其他光線通過,并且無論在何處,它們都描繪出周圍環(huán)境的圖像。
但如果針孔相機(jī)被設(shè)計為僅允許通過足以形成可讀圖像的光線,那么一堆雜亂的雜物會產(chǎn)生無法識別的的圖像、(通過光傳輸)被擾亂的陰影的復(fù)雜運(yùn)動。
可以將雜物想像成一面鏡子,使我們可以看到周圍的環(huán)境,尤其是在無法直接看到的角落。這個算法所解決的挑戰(zhàn)是要弄清并理解這些照明的提示。
具體而言,目標(biāo)是通過光傳輸和隱藏視頻,將隱藏場景中活動恢復(fù)為人類可觀看的內(nèi)容。但是,解密卻被證明是一個經(jīng)典的“先有雞還是先有蛋”的問題。為了理解加擾模式,用戶將需要知道隱藏的視頻,反之,為了知道隱藏的視頻,用戶將需要理解加擾模式。
“從數(shù)學(xué)上來說,就像我告訴你我正在考慮兩個秘密數(shù)字,它們的乘積是80。你能猜出它們是什么嗎?也許40和2?還是371.8和0.2152?對于我們的問題,我們在每個像素上都面臨類似的情況,” Aittala說,“幾乎所有隱藏的視頻都可以通過相應(yīng)的加擾來解釋,反之亦然。如果我們讓計算機(jī)進(jìn)行選擇,它只會為我們提供一大堆看起來什么都不像的隨機(jī)圖像。”
考慮到這一點,團(tuán)隊致力于通過算法上指定一種與現(xiàn)實中的陰影相對應(yīng)的“加擾”模式來消除歧義,以重現(xiàn)隱藏的視頻,看起來它具有邊緣,以及移動時具備一致的對象。
新的算法有助于消除歧義
該團(tuán)隊還利用了一個令人驚訝的事實,即使從未受過訓(xùn)練的神經(jīng)網(wǎng)絡(luò)自然也喜歡表達(dá)“類似圖像”的內(nèi)容,這有助于消除歧義。
算法使用了機(jī)器學(xué)習(xí)中“深層圖像優(yōu)先級”的概念,同時訓(xùn)練兩個神經(jīng)網(wǎng)絡(luò),這兩個神經(jīng)網(wǎng)絡(luò)僅專用于一個目標(biāo)視頻。一個網(wǎng)絡(luò)產(chǎn)生加擾模式,另一個網(wǎng)絡(luò)估計隱藏的視頻。當(dāng)這兩個因素再現(xiàn)了從混亂中錄制的視頻時,網(wǎng)絡(luò)就會得到“獎勵”,驅(qū)使它們用合理的隱藏數(shù)據(jù)來解釋觀察結(jié)果。
為了測試該系統(tǒng),團(tuán)隊首先將物體堆放在一堵墻上,然后放映視頻或在對面的墻上移動自己的物理位置。由此,他們可以重現(xiàn)視頻,使您可以大致了解房間隱藏區(qū)域中正在發(fā)生的運(yùn)動。
將來,該小組希望提高系統(tǒng)的整體分辨率,并最終在不受控制的環(huán)境中測試該技術(shù)。
相關(guān)報道:
https://news.mit.edu/2019/using-computers-view-unseen-computational-mirrors-mit-csail-1206


