來源:Google AI
編輯:大明、SHAO
【新智元導讀】谷歌AI年終大盤點終于來了。谷歌AI負責人Jeff Dean親自執筆,回顧2019年谷歌AI的重大技術突破和應用。暖暖的人文關懷與炫酷的新技術突破完美結合,這份總結雖然來得晚了點,但干貨滿滿。 戳右邊鏈接上新智元小程序 了解更多!
Google的目標是致力于解決長期問題,重點是那些在日常生活中能極大幫助人們的問題。為了在2019年實現這一目標,Google Research基礎研究的多個領域取得了進展,并將研究成果應用于醫療保健和機器人等新興領域,開放了大量源代碼,并繼續與產品團隊合作,構建對用戶更有幫助的工具和服務。
在2020年到來之際,本文回顧和評估在過去一年中所做的研究工作,并展望在未來幾年中要解決什么樣的問題。這篇文章是對Google研究人員和工程師在2019年期間所做的一些工作的總結,包括 AI道德倫理、AI社會效益、手機智能輔助、健康、量子計算、機器學習算法、自然語言理解、機器人技術等諸多方面的研究成果。
下面一起來看看這一年Google都在做些什么吧!Google每時每刻都在創造新技術,書寫新未來。
AI應用的道德準則
AI應用的道德問題一直是飽受爭議的話題,人類的歧視和偏見會通過數據滲透到機器學習的模型,也是很多社會學家關注的焦點。2018年,Google發布了一套AI原則,通過這個原則提供的框架可以評估Google對自家產品中機器學習等技術的研究和應用。
2019年6月,Google發布這個框架的更新版,介紹了這些原則在Google研究和產品開發工藝中的實踐過程。Google的目標是將這些領域中目前已知的最佳技術應用到實際工作中,持續推動這些重要領域的技術開發。
AI造福社會:預測災害,保護自然
機器學習在解決許多重要的社會問題方面具有巨大的潛力,2019年,Google一直在幾個這樣的領域中開展工作,并致力于使其他人能夠運用其創造力和技能來解決此類問題。這些工作覆蓋廣泛,包括:使用機器學習、計算和更好的數據源來做出更準確的洪水預報,然后向受災地區的數百萬部手機提供的警報;與野生動植物保護組織合作,使用機器學習來幫助分析野生生物相機數據等。
AI預測洪水災害
計算機科學和機器學習在其他科學領域的應用也是Google特別關注的領域,在多組織協作研究中發表不少論文。今年的一些亮點包括:
- 利用能追蹤每個神經元的機器學習模型,實現了繪制整個飛行大腦結構的里程碑。
- 為偏微分方程(PDE)學習更好的模擬方法,
- 使用深度學習來預測分子的嗅覺特性。利用圖神經網絡(GNN)直接預測單個分子的氣味描述符。
嵌入空間的2D快照,突出顯示了一些示例氣味。左:每種氣味都聚集在自己的空間中。右:氣味描述符的層次性質。陰影和輪廓區域使用嵌入核密度估計計算
AI輔助技術:為功能障礙人士打開新世界
看到豐富多彩的圖像,聆聽喜歡的歌曲,與親人交談…… 這些看似理所當然的能力卻成為功能障礙人士感受這個世界的障礙。機器學習技術可以通過將這些信號(視覺,聽覺,語音)轉換成其他信號,使這些信號可以由具有可訪問性的人們很好地管理,從而更好地訪問周圍的環境。
在上個月Youtube上名為《AI時代》的紀錄片中,介紹了Google的一項技術。對于患有ALS(漸凍癥)和其他情況下會產生口齒不清或非標準語音的人,google技術實現了個性化語音到文本的轉錄,繼而模擬患者健康時候的聲音與家人交流。
醫療健康領域:輔助診斷水平媲美人類專家
2018年末,谷歌健康團隊、Deepmind Health和谷歌硬件部門專注于健康相關應用的團隊合并成了谷歌健康。2019年,Google健康團隊成果顯著:
- 針對乳房X線照相術的深度學習模型可以幫助醫生發現乳腺癌;
- 用于皮膚疾病鑒別診斷的深度學習模型可以提供比初級保健醫師更準確的結果;
- 提前兩天預測急性腎損傷(AKI)的發作
- 為病理學家構建了以人為中心的圖像搜索工具,通過檢查相似病例幫助他們做出更有效的診斷。
除了在人文關懷領域的研究成果外,Google也總結了在硬科技和學術領域的研究成果。
量子計算:200秒超算1萬年的問題
在2019年,Google的量子計算團隊首次展示了一種計算任務,該任務世界上最快的經典計算機上需要10000年,但在量子處理器上僅需200秒。Google將重點放在實現量子誤差校正上,以保證運行更長時間的運行。同時讓量子算法更易于表達,更易于控制硬件,并使用經典機器學習技術建立更可靠的量子處理器,為使實用量子計算在更廣泛的問題上成為現實,邁出了早期的一步。
一般領域算法和理論
在一般領域的算法和理論,我們繼續我們的研究,從算法的基礎到應用,并且也做了工作圖挖掘和市場的算法。Google在去年6月的一篇博客文章總結了在圖學習算法方面的一些工作,提供了有關該工作的更多詳細信息,同時介紹了在多個平臺發表的多篇論文,展示了在這個領域的研究成果。
機器學習算法
Google在機器學習算法的不同領域進行了研究,主要的重點是了解神經網絡中訓練動力學的性質。Google研究人員提供了一組仔細的實驗結果,這些結果表明縮放數據并行性的數量對于使模型收斂更快有效。
對于我們測試的所有工作負載,我們觀察到批次大小與訓練速度之間存在三種通用的關系:小批次大小的完美擴展(沿虛線),隨著批次大小的增長(與虛線不同)最終收益遞減,以及在最大批量(趨勢平穩)時的最大數據并行度。在不同工作負載之間,方案之間的過渡點差異很大。
推進機器學習算法的重點主要是推進學習更好的表示形式,這些表示形式可以更好地推廣到新的實例、問題或領域中。
AutoML:自動決策水平堪比人類專家
2019年,google繼續AutoML的研究,在某些類型的機器學習元決策上,取得了比最優秀的人類機器學習專家更好的決策水平。
在探索權重不可知神經網絡中,Google展示了如何無需任何訓練步驟即可更新有趣的神經網絡體系結構以更新評估模型的權重。這可以使體系結構搜索的計算效率更高。權重無關神經網絡可以在各種不同的權重參數下執行任務。
自然語言理解:BERT開辟NLP新世界
左:具有大量訓練數據的語言對通常具有較高的翻譯質量。右圖:多語言培訓,其中我們針對所有語言對訓練一個模型,而不是針對每個語言對訓練一個單獨的模型,這導致沒有太多數據的語言對的BLEU得分(翻譯質量的度量)得到了顯著提高。
隨著語言理解能力的提高,基于 seq2seq ,Transformer ,BERT ,Transformer-XL 和ALBERT 模型等基礎研究的進展,Google已經在許多核心產品和功能(如 Google Translate ,Gmail的 Smart Compose 和Google搜索)中應用了這些模型 。今年, Google在核心搜索和排名算法中推出BERT,實現了過去五年來搜索質量的最大提升。
機器人技術:學習更快,無懼環境變化
機器學習在機器人控制中的應用,是機器人在復雜的現實環境中有效運行的重要工具。過去的一年中,Google在這一領域實現了諸多成果。利用強化學習,機器人能夠更有效地在復雜環境中進行導航。機器人能夠僅從圖像中高效學習,從環境中的實驗中學習“直觀”的現實世界,而非通過預編程的模型來學習。訓練強化學習算法既可以最大化期望的獎勵,又可以最大化策略的熵,讓機器人學得更快,對環境的變化也更加穩健。
同時,通過學習從自監督的反匯編中進行組裝和泛化,機器人學會了對目標的拆解和組裝。孩子們可以從拆解中學到東西,機器人也可以!
開發者和研究人員社區更加開放
開源不僅僅指代碼,還包括開發者社區。2019年,Google推出了TensorFlow 2.0,讓構建機器學習系統和應用程序比以往更加輕松。
全球1500多名研究人員能夠通過TensorFlow Research Cloud免費訪問CloudTPU。同時,Google在Coursera的發布的TensorFlow課程吸引了 10萬學生。在TensorFlow的幫助下,一名大學生還發現了兩個新行星,并建立了幫助其他人發現更多行星的方法。
新的數據集有助于社區探索和開發新技術。為了幫助研究社區找到有趣的數據集,Google能夠搜索來自許多不同組織的各種開放數據集。
2019年,谷歌研究人員在機器學習頂級學術會議(如CVPR、ICML、ICLR、ACL、ICCV、NeurIPS等)上發表了數百篇論文,參加演講等活動,獲得大量獎項。
展望2020:面臨的挑戰
過去十年,機器學習和計算機科學領域取得了顯著進步,我們現在已經讓計算機會看、會聽、會理解語言,同時也有了可以應用這些功能的復雜計算設備,可以更好地幫助我們完成日常生活中的許多任務。通過開發專用硬件,我們利用機器學習方法重新設計了計算平臺,解決越來越大的問題。這場深度學習革命,將繼續重塑我們對計算和計算機的觀點和概念。
不過,現在仍然存在大量尚未解決的問題,比如:、
- 如何構建可處理數百萬個任務,還能學習如何自動成功完成新任務的機器學習系統?
- 如何在人工智能研究的重要領域推進最新技術的應用,如何避免算法偏見,增加模型的可解釋性和可理解性,改善隱私、確保安全?
- 如何應用計算和機器學習在重要的新科學領域取得進步?
- 如何確保機器學習和計算機科學研究領域所追求的思想和方向,是由一群構成多元化的研究人員提出和探索的?
- 如何更好地支持來自不同背景的新研究人員進入機器學習領域?
總體而言,對于Google來說,2019年是令人振奮的一年。在2020年,Google要準備好迎接更多的挑戰!
https://ai.googleblog/2020/01/google-research-looking-back-at-2019.html


