你的AI幫手,正在……或許正在竊聽你。
蘋果、微軟、Google……海外幾家大公司,都先后被曝出使用智能音箱/手機,偷錄用戶談話,并將部分含有用戶隱私之錄音,發(fā)送給了擔任識別準確度核對的第三方承包商。
這些片段的內(nèi)容形形色色:性錄音、家庭八卦、親友之間的通話內(nèi)容……乃至還有疑似毒品買賣現(xiàn)場的談話。而外包團隊在擔任核對之余,還會將含有“笑料”的片段,在公司內(nèi)部傳播取樂。
一個AI背面,到底有多少人在偷聽你?
隔墻有耳
第一個倒下的是亞馬遜。
今年4月11日,彭博的一篇報導,拉開了“AI竊聽門”的前奏:亞馬遜為了強化Alexa智能幫手的體現(xiàn),在全球規(guī)模內(nèi)雇用了上千名人類職工,對Alexa智能音箱錄下的聲響片段進行人工檢查和監(jiān)聽。
一名人類職工,每天最多會聽到大約1000條亞馬遜發(fā)來的用戶錄音。他們需求將錄音轉(zhuǎn)述成文字,為特定的關(guān)鍵詞打上符號,最后再將轉(zhuǎn)寫下來的文字和音頻歸檔。
問題在于,亞馬遜送來的對話里,有時會攙雜一些古怪的東西:浴室里傳來的跑調(diào)歌聲、小孩子的尖叫、模糊不清的求助聲……這些都是語音幫手被誤喚醒時錄下的片段。而據(jù)報導,擔任審閱的職工們,似乎并不太在意這些錄音的私密性。遇到特別有意思的片段,還會在公司內(nèi)部共享,以此取樂。
面臨這種丑聞,亞馬遜方面迅速做出了回應,稱人類職工對錄音作出的符號,有助于Alexa改善理解能力。并且公司有著嚴格的保密措施,職工無法直接取得跟錄音相關(guān)聯(lián)的賬號信息。被符號的用戶錄音,也只是Alexa所錄片段中極少數(shù)的一部分。
7月份,事情開端失控:Google的語音助理也被曝出,有人類職工在背面監(jiān)聽智能音箱,和手機App的錄音內(nèi)容。外媒乃至拿到了一段Google語音助理錄下的片段,垂手可得地找到了這份錄音的原主人。
等到月底,蘋果的Siri也加入了竊聽門的行列。因為Apple Watch更簡單誤觸,審閱人員聽到的內(nèi)容也愈加糟糕:拉拉鏈的聲響(顯然是剛上完廁所)、毒品買賣現(xiàn)場、以及……不慎被HomePod/Apple Watch錄下來的滾床單片段。
說好的“What happens on your iPhone, Stays on your iPhone. ”呢?
8月份,更過火的來了:微軟被曝出監(jiān)聽用戶的Skype通話內(nèi)容,以及跟Cortana之間的交談記錄。據(jù)外媒報導,微軟這邊能聽到的內(nèi)容也是形形色色:翔實的地址信息、十分露骨的搜索懇求、和某些不能詳細描述,反正是帶點色彩的Skype記錄。
至于監(jiān)聽用戶Skype通話的理由,微軟后來回應稱,是為了改善那項2015年發(fā)布的,內(nèi)置在Skype當中的AI同傳服務。只不過他們其時沒告知你,除了AI之外,聽你說話的還有其他人。
最后一個淪亡的是Facebook。盡管沒有語音幫手,但他們?nèi)允菍⑵煜翭acebook Messenger 中用戶發(fā)送的語音轉(zhuǎn)文字消息,通過外包方式交給了第三方進行核對。盡管涉及規(guī)模不如前面幾家公司廣泛,但爆料人士依然指出,有部分錄音內(nèi)容“相當靈敏”。
大公司們?yōu)槭裁匆鲞@種事?人工智能,不是挺聰明的嗎?
人工智能的B面
有多少智能,就有多少人工。
現(xiàn)如今什么產(chǎn)品都講究一個“增才智”。從AI攝影到AI幫手,線上才智生活無處不在。但鮮少人知的是,養(yǎng)AI跟養(yǎng)孩子差不多。需求有人不斷地教給它們什么是對,什么是錯,才干得到越來越準確的成果。
圖像切割 、圖像識別、語音轉(zhuǎn)文字、語義切割……這些都需求有人類從旁協(xié)助。原始錄音便是問題,而人類整理好的書寫內(nèi)容,就像單詞卡片背面的答案。
人工智能越來越熱,這些用數(shù)據(jù)飼喂AI的人,也越來越多。需求讓AI理解人類言語?那就讓人類把一句話依照規(guī)則拆開,再交給程序去學習。需求讓AI學會看路?那就先讓真人把照片里的車、人、路燈……通通做好符號,再交給AI去漸漸認就好了。
沒錯,拿脫敏過的用戶錄音給人類聽,再用成果去矯正AI,其實算是舉球通行的慣例。假如不信,你能夠看看百度DuerOS的這份隱私政策:
以及,這是小愛同學的:
和天貓精靈的:
換句話說,你有權(quán)保持沉默(或許拔插銷),但你被錄下來的每一句話,不論有意仍是無意,都或許成為喂食AI的飼料。并且他們并沒有告知你,“用于改進和提高產(chǎn)品”的潛臺詞是,你對音箱所說的話,也或許會有人類作業(yè)人員聽到。
嚴格來說,這些信息應當只在企業(yè)內(nèi)部共享,并且職工對錄音內(nèi)容負有保密義務。盡管你不小心被AI錄下來的黃段子(或許別的什么更糟糕的東西)有一定概率會被人類聽到這件事十分讓人不爽,但平心而論,這算不上什么隱私泄露事故。
當然了,這不代表這些做法沒問題,咱們等會兒再說這個。
“飼養(yǎng)AI”曾經(jīng)一度催生了巨大的下游產(chǎn)業(yè)。智能音箱最熾熱的時分,乃至呈現(xiàn)了很多專做數(shù)據(jù)標示的外包團隊。不需求學歷,不需求經(jīng)驗,通過簡單的培訓,一個人很快就能學會給圖片拉框,給人臉加點,把語音轉(zhuǎn)成文字……
不知道有沒有人意識到這當中的荒唐:從誕生的第一天起,這份作業(yè)的最高目標,便是消除本身。
(這種驗證碼本質(zhì)上也是數(shù)據(jù)標示)
還有一些公司,將這種“時刻密集型”作業(yè),做成了誰都能夠在家賺外快的網(wǎng)絡任務。他們需求做的或許是教AI聽懂人話、識別人類的骨骼點,或許是給聊天機器人編寫一些有意思的回復。
被制造的素材,和標示數(shù)據(jù)的人一樣,都只是完結(jié)AI所有必要的東西罷了。
大數(shù)據(jù)=無隱私?
歡迎來到21世紀。
收集數(shù)據(jù)-脫敏-分析,是當代大數(shù)據(jù)應用的通行做法,也被多國監(jiān)管部門認可。但是有研究表明,這種做法其實沒什么效果。
英國倫敦帝國理工學院的研究人員,使用揭露的匿名數(shù)據(jù)訓練了一個AI,成果只用到了生日,性別,居住地郵編和子女數(shù)量,就能從匿名數(shù)據(jù)集中,定位出整個馬薩諸塞州79.4%的人口。假如特征量進一步添加,準確度乃至能到達99%以上。
換句話說,即便拿掉了姓名、電話和身份證號,仍是有辦法從大數(shù)據(jù)中找出特定的某個人。何況依據(jù)之前的報導,檢查人員仍是能聽到用戶親口說出的私密內(nèi)容。所謂的隱私把控,好像從數(shù)據(jù)脫敏這一步開端就現(xiàn)已失靈了。
更可怕的是,集中存放的隱私數(shù)據(jù),本身便是一塊亮光的肥肉:海外一間指紋鎖公司Suprema因為安全漏洞,被人摸到了超過100萬人的指紋和人臉識別數(shù)據(jù),且關(guān)鍵信息大多未經(jīng)加密。密碼走漏能夠再改,人臉識別數(shù)據(jù)被人偷走,恐怕只有換臉才干解決。
(走漏出來的后臺數(shù)據(jù)截圖)
隨著智能設備越來越深入地進入家庭,咱們在各種系統(tǒng)中被留下,又被走漏的痕跡,只會越來越多。這樣說來,在家里洗澡時的跑調(diào)歌聲被數(shù)據(jù)標示員聽到,現(xiàn)已是各種AI相關(guān)事故鄉(xiāng)損害最小的一種。
數(shù)據(jù)便是力量
某種意義上說,被大數(shù)據(jù)和AI包圍的,極點便利的現(xiàn)代生活,是以咱們對本身隱私數(shù)據(jù)的讓渡為價值的。麥克風、攝像頭、GPS、指紋傳感器……他們收集到的數(shù)據(jù),隨時能夠成為追尋和監(jiān)看你的絕好素材。不同在于,看著這些數(shù)據(jù)的究竟是無愛情的機器,仍是活生生的,懷有好心或惡意的人類?
大多數(shù)人對此毫無知覺,也無法操控。被曝光之后,海外的幾家大公司,都先后宣布中止了外包團隊對用戶錄音的審閱。Alexa和Google也提供了入口,答應用戶刪掉他們留在平臺上的錄音材料。最少在海外,他們對自己的數(shù)據(jù)多了一點掌控。
但在國內(nèi),想刪去自己的數(shù)據(jù)沒這么簡單。小米和百度的個人信息刪去,都需求向指定郵箱發(fā)送郵件來提出申請,天貓精靈則需求聯(lián)絡客服。并且跟海外不同,這些刪去懇求都帶有十分嚴格的附加約束。
這些東西都藏在幾乎沒人會讀的隱私條款里。粗略看下來,一個普通用戶想刪掉自己的個人信息,難如登天。
跟AI一起走向老練的這一代人,現(xiàn)已不可避免地,成了大公司喂飼給機器學習的數(shù)字飼料。僅有的問題是,等到AI足夠聰明的那天,這種飼喂會停下來嗎?
或許說,下一代人還會在乎這件事嗎?


