編輯:張佳
【新智元導讀】手握搜索引擎和輸入法兩張王牌,搜狗在AI同傳領(lǐng)域又放出大招——搜狗同傳3.0驚艷亮相。基于搜狗獨創(chuàng)的“語境引擎”,搜狗同傳3.0以“多模態(tài)”和“自主學習“為核心,加入視覺和思維能力,讓AI同傳不僅會聽,還首次具備了會看、能理解會推理的能力。搜狗一小步,同傳一大步。戳右邊鏈接上新智元小程序 了解更多!
“全球95%的信息是用英文所寫的,100%的國際商貿(mào)活動是用英文的,因此如何幫助中國人跟外國人進行更好的交流,這變成了一個重大的技術(shù)課題。”
搜狗公司CEO王小川的這席話道出了多少中國人的心聲?
近日,王小川在某科技大會的演講中談到了“語言AI的未來構(gòu)想”:我們作為做輸入法、搜索以語言為核心的公司,投了很多的力量來做相關(guān)的積累。
這里說的積累包含搜狗的OCR技術(shù)、NLP技術(shù)、知識圖譜技術(shù)等等,而這個積累的成果終于重磅亮相,它就是“搜狗同傳3.0”。搜狗同傳3.0在這場大會上的首秀驚艷四座,快速準確的同步翻譯王小川的演講內(nèi)容,感受下:
業(yè)內(nèi)首創(chuàng)多模態(tài)同傳,PPT翻譯正確率提升40.3%,搜狗同傳3.0如何實現(xiàn)“能聽會看會思考”?
基于搜狗獨創(chuàng)的“語境引擎”,搜狗同傳3.0以“多模態(tài)”和“自主學習“為核心,加入視覺和思維能力,讓機器同傳不僅能聽,還首次具備了會看、會思考、會推理的能力,引領(lǐng)AI同傳進入了多模態(tài)認知時代。
- 會看 :通過OCR、NLP等技術(shù),實時捕捉并分析PPT核心詞
- 會思考 :基于知識圖譜技術(shù),廣泛擴展專業(yè)領(lǐng)域詞匯
搜狗同傳產(chǎn)品總監(jiān)張晶晶介紹道:“用攝像頭或者數(shù)據(jù)線插在視頻上實時通過OCR捕捉演講人正在演講的PPT內(nèi)容,實時分析PPT核心關(guān)鍵詞,就增強了視覺的能力。”
在這樣一套系統(tǒng)下,搜狗同傳3.0可以更像一個專家和內(nèi)行一樣的去解讀和翻譯大會。具體來說,使現(xiàn)有AI同傳技術(shù)從3方面進行了提升:
- 更專業(yè) ,以往的AI同傳模型是通用的,現(xiàn)在通過這套系統(tǒng)形成了實時專屬的定制加強的能力,能夠?qū)崟r捕捉PPT的內(nèi)容,補充演講專業(yè)領(lǐng)域的知識,并且針對每一個演講的模型定制,提升同傳效果。
- 更智能 ,以往模型訓練需要一個被動學習的過程,現(xiàn)在自動學習PPT的內(nèi)容,自動捕捉海量詞匯,確保同傳品質(zhì)非常優(yōu)秀。
在專業(yè)術(shù)語多的大會上,搜狗同傳3.0的優(yōu)勢更加明顯,具體效果見下圖:
除了大會演講的同傳外,搜狗同傳3.0作為一套完整的技術(shù)體系正在更多的場景應用,比如記者采訪、跨國辦公會議、視頻直播、旅游出行、法院庭審等。
大廠紛紛押注AI同傳,為什么以搜索起家的搜狗更具優(yōu)勢?
這兩年,AI同傳市場很熱鬧,以百度、騰訊、訊飛為代表的大廠紛紛推出自家的AI同傳,也有一些被用在了世界級大會上。那么,作為最早一批入局AI同傳的搜狗優(yōu)勢在哪?又有什么不同的理念呢?
搜狗同傳一直代表著 AI 同傳領(lǐng)域頂級的水平,早在2018年的IWSLT國際口語機器翻譯評測大賽上,搜狗就擊敗訊飛、阿里、APPTEK、AFRL及KIT等國內(nèi)外頂尖對手,奪得冠軍,實力可見一斑。
其實, AI同傳面臨的挑戰(zhàn)主要有兩個:一是準確性,二是低延時。
此外,搜狗的兩大利器——搜索引擎和輸入法在提升準確性方面也派上了大用場。
說話人開口講了半句話,同聲傳譯就要開始翻譯了。為了降低延時,搜狗同傳3.0做了一個基于上下流的解碼,通過一個信息模塊來實時檢測說話人什么時候斷句,再借助搜狗強大的知識圖譜迅速整理翻譯,這樣就可以大大降低延時。
搜狗同傳領(lǐng)先的不僅是技術(shù),還有眼光。當前,搜狗AI的技術(shù)布局聚焦在自然交互和知識計算上。在語言之上提取出跟語言的關(guān)聯(lián)關(guān)系,讓機器產(chǎn)生人的“認知”能力,王小川稱之為知識計算。怎么更好的把從大量數(shù)據(jù)中抽取出的知識用在同傳中、怎么計算出更多的知識給同傳用,這正是搜狗同傳努力的方向。
搜狗同傳3.0的發(fā)布,是搜狗又一次在同傳領(lǐng)域的技術(shù)創(chuàng)新,讓AI同傳首次具備了視覺能力和思考能力,開啟了AI同傳行業(yè)全新的“多模態(tài)認知”時代。AI同傳替代人工同傳還會遠嗎?


