智東西(公眾號:zhidxcom)
文 | Lina
智東西12月2日消息,上周,推出了一款新的模型——全名叫“基于復(fù)數(shù)網(wǎng)絡(luò)的語音增強(qiáng)和聲學(xué)建模一體化的端到端語音識別模型”,并推出了三款基于百度鴻鵠語音芯片的硬件模組及開發(fā)板,以及基于智能家居、智能車載、智能IoT設(shè)備這三大場景的行業(yè)解決方案
▲百度AI技術(shù)生態(tài)部總經(jīng)理喻友平、百度語音首席架構(gòu)師賈磊
發(fā)布會當(dāng)天,智東西與少數(shù)媒體一同對百度語音首席架構(gòu)師賈磊、百度AI技術(shù)生態(tài)部總經(jīng)理喻友平進(jìn)行了專訪。賈磊告訴智東西,深度學(xué)習(xí)的下一步方向就是這種跨領(lǐng)域融合的技術(shù),目前深度學(xué)習(xí)的端到端、跨學(xué)科整合方面正在快速發(fā)展,不斷對已有學(xué)科進(jìn)行著顛覆。
一、深度學(xué)習(xí)的下一步:跨領(lǐng)域融合
傳統(tǒng)遠(yuǎn)場語音交互技術(shù),首先要對聲音進(jìn)行數(shù)字信號處理(信號增強(qiáng)、波束生成等),接著再對其進(jìn)行語音識別,涉及數(shù)字信號處理和語音識別這兩大學(xué)科。
而百度新推出的基于復(fù)數(shù)CNN網(wǎng)絡(luò)的語音增強(qiáng)和聲學(xué)建模一體化的端到端語音識別模型則打破了上述傳統(tǒng)流程,以一套深度學(xué)習(xí)模型代替整個流程。系統(tǒng)直接輸入多路麥克風(fēng)信號,輸出目標(biāo)語音文字,不需要任何聲學(xué)先驗知識。
在采訪中,賈磊告訴智東西,百度這款新模型在語音識別過程中就引入了語義理解技術(shù),對聲學(xué)與語言進(jìn)行一體化的建模。
針對當(dāng)前業(yè)內(nèi)存在的“深度學(xué)習(xí)是否遇到技術(shù)創(chuàng)新平臺期問題?”,賈磊認(rèn)為當(dāng)前深度學(xué)習(xí)還在快速發(fā)展當(dāng)中,深度學(xué)習(xí)的下一步方向就是這種跨領(lǐng)域融合的技術(shù),目前深度學(xué)習(xí)的端到端、跨學(xué)科整合方面正在快速發(fā)展。
二、AI芯片核心理念:軟件驅(qū)動芯片設(shè)計
在發(fā)布會現(xiàn)場,百度AI技術(shù)生態(tài)部總經(jīng)理喻友平還推出了三款基于百度鴻鵠語音芯片的硬件模組及開發(fā)板。
百度的這款新模型搭配百度鴻鵠語音芯片,能夠?qū)⒄Z音識別準(zhǔn)確率提高30%以上。而即便設(shè)備沒有搭載百度專用的鴻鵠語音芯片,而是搭載其他傳統(tǒng)ARM芯片,這套新模型也能讓遠(yuǎn)場語音識別、首次喚醒準(zhǔn)確率大幅提升。
賈磊告訴智東西,百度作為互聯(lián)網(wǎng)巨頭,進(jìn)軍AI芯片的核心理念是以軟件驅(qū)動芯片設(shè)計。市面上現(xiàn)有的傳統(tǒng)芯片并不適合專用的低功耗AI語音計算。
舉個例子,現(xiàn)在支持語音喚醒與識別的Arm架構(gòu)芯片運行功率普遍在1W以上,難以滿足家電產(chǎn)品的超低功耗需求。而目前百度鴻鵠芯片的待機(jī)功率在100mW以下,滿負(fù)荷運載功率在200mW以下,是極少數(shù)功耗能夠符合國家3C認(rèn)證標(biāo)準(zhǔn)的芯片,可以搭載在電視等家電產(chǎn)品中。
三、AI開放平臺已實現(xiàn)規(guī)模營收,“增速很快”
喻友平說,百度大腦開放平臺目前是國內(nèi)服務(wù)規(guī)模最大的AI開放平臺,有228項開放的技術(shù)能力,同時也服務(wù)著全國最大群里的AI開發(fā)者——超過150萬人,其中90%!95%以上是企業(yè)用戶。
喻友平告訴智東西,當(dāng)前,百度大腦通過平臺化的方式為企業(yè)提供AI技術(shù)與解決方案,目前已經(jīng)實現(xiàn)了規(guī)?;臓I收,并且營收增速非??臁?/p>
當(dāng)前,百度大腦所開放的AI技術(shù)在公司集團(tuán)內(nèi)部擁有著廣泛的應(yīng)用場景,比如百度地圖、百度輸入法等等。喻友平表示,內(nèi)部有廣泛應(yīng)用使得百度能夠?qū)I技術(shù)進(jìn)行打磨與積累,在這個過程中把越來越多的AI應(yīng)用場景打造得更加符合外部企業(yè)的需求,開放給各類廠商。


