百度CTO王海峰博士致辭
雷帝網 樂天 11月28日報道
百度大腦今日宣布語音能力引擎日均調用量超過100億次,應用規(guī)模業(yè)界第一,為開發(fā)者提供了覆蓋云、端、芯的全棧全場景語音開放能力,推動智能語音技術在各行業(yè)落地應用。
論壇上,百度大腦語音引擎全新發(fā)布和升級了14大產品內容,包括基于百度鴻鵠語音芯片的4款硬件模組、開發(fā)板及3大場景解決方案,升級了語音自訓練平臺、呼叫中心語音解決方案等。
百度首席技術官王海峰博士在現(xiàn)場表示:“AI技術的進化和產業(yè)賦能正向循環(huán),相互促進,AI在應用場景中不斷進化。”
“百度的語音技術基于深度學習和產業(yè)應用加速突破,已應用到百度App,百度地圖、小度音箱,百度輸入法等百度產品,更通過AI開放平臺賦能眾多產業(yè)伙伴。百度大腦語音能力每天的調用量已經超過100億。”
百度語音首席架構師賈磊正式提出基于復數(shù)CNN網絡的語音增強和語音識別一體化端到端建模技術,稱該方法拋棄了數(shù)字信號處理學科和語音識別學科的各種先驗假設,消除學科間壁壘,直接端到端進行一體化建模。相較于傳統(tǒng)基于數(shù)字信號處理的麥克陣列算法,錯誤率降低超過30%。目前該方法已經被集成到百度最新發(fā)布的百度鴻鵠芯片中。
百度語音首席架構師 賈磊
百度從2012年起就開始把深度學習用于中文語音搜索,成為全世界最早把深度學習技術落地工業(yè)化產品的企業(yè)之一。百度大腦目前已開放了云、端、芯包含語音識別、語音合成等全棧語音引擎能力,并廣泛應用于金融、政務、文娛等多種行業(yè)和場景。
百度AI技術生態(tài)部總經理喻友平表示,百度大腦語音能力引擎的應用規(guī)模已達到業(yè)界第一,一直在積極拓展語音能力引擎生態(tài)鏈的建設。
百度AI技術生態(tài)部總經理 喻友平
針對智能硬件設備,百度大腦重磅發(fā)布基于百度鴻鵠語音芯片的4款硬件模組、開發(fā)板,以及智能家居、智能車載、智能IoT設備3大端到端軟硬一體遠場語音交互場景解決方案,具備交互效果優(yōu)異、軟硬一體快速應用、廣泛兼容集成門檻低等優(yōu)點。
同時,在語音識別領域,全面升級短語音識別、實時語音識別能力,發(fā)布音頻文件轉寫能力,升級可零代碼提升業(yè)務術語識別率的語音自訓練平臺,以及呼叫中心語音解決方案;
在語音合成方面,發(fā)布6個在線語音合成精品音庫和5個離線語音合成精品音庫。語音能力,助力智能硬件、互聯(lián)網、呼叫中心等領域智能化升級。
創(chuàng)維AIoT研究院產品經理李凱介紹:“大屏IoT的行業(yè)痛點在于信息檢索難和設備控制操作復雜,通過增加語音交互能力,重構了整個AIoT設備生態(tài)的交互體驗。雙方在電視方面的合作成果已落地在10個電視芯片型號、2500萬臺電視上,助力中端及高端產品線提升了產品溢價能力。”
據(jù)百度介紹,在下一代遠場語音方案中,百度鴻鵠語音芯片為創(chuàng)維產品帶來高性價比硬件、整合優(yōu)化的軟件算法等價值,雙方將基于百度鴻鵠芯片展開多項產品的合作。
今年年初,百度還提出截斷注意力模型SMLTA,使得句子的整句識別率、方言的識別以及中英文混合的識別率顯著提升,也是在全球范圍內第一個實現(xiàn)語音識別領域注意力模型的大規(guī)模工業(yè)在線產品落地。
首創(chuàng)Tacotron+wavRNN聯(lián)合訓練,成為全球首個上線waveRNN技術的語音平臺,大幅提升云端合成速度,語音合成的自然度幾乎達到真人的效果。
百度地圖20句話即可錄制語音導航的技術基于百度獨創(chuàng)的風格遷移技術Meitron模型,特點主要體現(xiàn)在音色轉換、多情感朗讀和韻律遷移三個方面,從而讓語音合成的門檻大大降低。
百度大腦開放平臺是國內服務規(guī)模最大的AI開放平臺,目前已開放228項AI能力,擁有超過150萬的開發(fā)者用戶。
這是百度首次在語音市場這樣公布成績。百度CTO王海峰會上親自宣布語音技術日調用量破百億數(shù)字,居行業(yè)第一,可見百度鉚足勁頭做語音的決心。
這個領域,垂直做語音的科大訊飛曾經呼聲很高,今年4月的數(shù)據(jù),訊飛稱宣布其日均總服務量為47億次,幾個月不太可能翻倍。
過去一年,訊飛的日子也不好過,科大訊飛市值從2017年11月22日的最高峰1565億元縮水到726億元;隨后又陷入“同傳造假”和“賣地疑云”。
隨著百度公布了語音技術日調用量破百億,國內第一,訊飛也會面臨更大壓力。
———————————————
雷帝觸網由資深媒體人雷建平創(chuàng)辦,若轉載請寫明來源。


