智東西(公眾號:zhidxcom)
文 | 心緣
智東西12月18日蘇州報道,今天上午NVIDIA創始人兼CEO黃仁勛在GTC China大會的主題演講中,公布在會話式AI和推薦系統方面的重要進展。(黃仁勛推新自動駕駛芯片!性能飆升7倍,牽手BAT滴滴大秀中國朋友圈)
下午,NVIDIA加速計算產品管理總監Paresh Kharya、NVIDIA企業邊緣計算總經理Justin Boitano、NVIDIA TensorRT產品市場負責人Siddarth Sharma接受智東西等媒體的采訪,就NVIDIA深度學習產品進行更具體的解讀。
Paresh Kharya表示,最終客戶最在乎能否用各種計算平臺來幫助他們降低成本、處理各種工作負載,同時不僅可以在今天利用這些硬件處理這些工作負載,并且在未來也能夠持續。要實現這一點,軟件定義平臺非常重要。
一、進軍會話式AI,數月覆蓋完成流程
今天,NVIDIA推出第七代推理優化軟件TensorRT 7。Paresh Kharya說,這是NVIDIA第一次真正實現實時會話式AI,并且可以準確的處理中間復雜的流程。
會話式AI是非常難的領域,要想把會話式AI做得比較有用,要符合兩個條件。首先是要在300毫秒內將整個三個部分完成,其次是要完成的非常智能。
在這個過程當中,有非常多復雜的模型需要計算。會話式AI全流程有三個部分:語音識別、語義理解和轉譯、語音合成與輸出。
據悉,NVIDIA做會話式AI已有數月時間,第一個版本只涵蓋了會話式AI當中的語義理解部分。
在不斷更新版本后,如今NVIDIA TensorRT 7基本上可以完成整個流程的計算。
二、GPU的優勢:全可編程且軟件定義
在Paresh Kharya看來,FPGA從設計時就是為模擬而用的,但是如果一個東西專為模擬而生,那么在真正實際應用過程中,它的表現反而可能沒有那么好。
做好一個FPGA,整個編程的時間就要幾個月,然后還要做在硬件層面對它進行編程。而AI演進速度飛快,甚至以分鐘計,因此必須在軟件端實現高度靈活的可編程。
Paresh Kharya表示,GPU是AI領域的專用芯片,其指令集是全可編程且軟件定義的,非常具有優勢。
另外,GPU架構向前兼容,硬件更迭隨著軟件不斷更新適應,且軟件庫內就能進行直接更新。無論是臺式機、筆記本、服務器,還是很大型的外設,在數據中心、邊緣或者是物聯網上,均可使用NVIDIA的平臺。
有些公司通過去掉GPU的圖形處理部分來提升AI算力和減少成本,對此Paresh Kharya表示,NVIDIA在圖象處理方面本身基礎就比較好,比如說其RT Core能夠加速圖象處理,Tensor Core做AI加速計算。
NVIDIA提供各種產品來滿足客戶不同需求,應用于數據中心的GPU沒有圖像處理部分,但有Tensor Core來做AI加速計算,還有RTX6000、RTX8000等新品兼具圖像加速和AI加速功能。
Paresh Kharya認為,NVIDIA的較大優勢在于可用于各種工作負載中來實現加速計算的統一架構。NVIDIA在游戲、圖形、高性能計算、AI各業務板塊均有很好的營收,NVIDIA可以進一步投入到我們的統一架構平臺的研發當中。
在做好硬件架構的基礎上,NVIDIA開發相應軟件來利用硬件平臺,一方面帶來更大的性能提升,另一方面也降低了開發門檻。
NVIDIA與開發者保持緊密溝通與合作,以保證TensorFlow等主流開源框架與NVIDIA硬件緊密兼容,同時NVIDIA在各種軟件功能和庫上做溝通,使一些外部開發者可以充分利用這些東西。
以TensorFlow為例,NVIDIA盡可能將更多軟件庫整合到TensorFlow中,使得開發者無需關心底層,直接利用NVIDIA提供的庫或新功能去開發他們想要的東西,并且可在任何NVIDIA硬件平臺上使用。
三、NVIDIA為何兼容Arm做加速計算?
近期NVIDIA宣布CUDA將兼容Arm HPC,對此Paresh Kharya表示,NVIDIA希望在進入的所有加速計算領域能給客戶更多選擇。
Arm架構在全球范圍內被廣泛應用,基于Arm架構的設備約1500億臺,可提供互聯、內存、CPU內核、計算能力等多元化支持。
在Paresh Kharya看來,Arm架構之所以如此成功,是因為它是一個開放平臺,各類公司均可在Arm架構上進行想要的創新。
Justin Boitano補充說,NVIDIA有Arm架構許可,在邊緣計算領域的汽車平臺等多個硬件均基于Arm架構。Arm具有低功耗、應用靈活的特點,能滿足很多客戶對邊緣計算的需求。


