本文從對話系統(tǒng)的分類介紹與評測目標(biāo)進(jìn)行分析,解釋了如何評測一個(gè)智能對話系統(tǒng)。
本文從對話系統(tǒng)的分類介紹與評測目標(biāo)進(jìn)行分析,解釋了如何評測一個(gè)智能對話系統(tǒng)。
自然語言對話作為新一代的人機(jī)交互媒介,已經(jīng)創(chuàng)建了廣泛的應(yīng)用程序。長期以來,研究人員一直在探索機(jī)器產(chǎn)生自然回復(fù)的不同方法,包括基于檢索的回復(fù),端到端的生成回復(fù),以及問答和推薦系統(tǒng)。 從智能家居設(shè)備到智能電話助手,從客戶服務(wù)到情感陪伴,我們周圍已經(jīng)出現(xiàn)了各式各樣的聊天機(jī)器人。 然而,智能對話系統(tǒng)的表現(xiàn)往往因不同的應(yīng)用場景和目標(biāo)而異,因此行業(yè)內(nèi)一直都沒有一個(gè)統(tǒng)一的對話質(zhì)量評測標(biāo)準(zhǔn)。
近年來,“如何評測一個(gè)智能對話系統(tǒng)”這個(gè)開放的問題引起了相關(guān)領(lǐng)域研究人員的極大關(guān)注。在過去的幾年時(shí)間里,我一直致力于探索智能對話系統(tǒng)的評測方法。由我設(shè)計(jì)的對話評測方法已經(jīng)在多款智能對話產(chǎn)品上得到驗(yàn)證,有效推動了產(chǎn)品的持續(xù)優(yōu)化和迭代。與此同時(shí),該評測方法被nlpcc2019選為開放域?qū)υ捪到y(tǒng)競賽的評測標(biāo)準(zhǔn),受到了領(lǐng)域?qū)<业恼J(rèn)可。
那么,對于這樣一個(gè)看似無解的問題,我是如何著手進(jìn)行設(shè)計(jì)的呢?
首先,對話評測是一個(gè)非常大的概念,它涉及到很多不同領(lǐng)域的知識,而且非常的主觀,無法用一個(gè)統(tǒng)一的標(biāo)準(zhǔn)評判。說白了,這個(gè)問題就是在評價(jià)一個(gè)人說話的水平,只不過被評價(jià)的對象是一個(gè)機(jī)器人。不過,這個(gè)事情也不是完全無章可循。我們可以通過聚焦和拆解的方法把這個(gè)大問題分成多個(gè)可量化的小問題。
事實(shí)上,想要有效的評測一個(gè)對話系統(tǒng),我們首先要知道被評測對話系統(tǒng)的目標(biāo)是什么。換句話說,就是我們期待對話系統(tǒng)給我們帶來什么樣的價(jià)值。只要明確了目標(biāo),我們就可以圍繞目標(biāo)建立標(biāo)準(zhǔn),再通過標(biāo)準(zhǔn)沿伸出評測的方法。
智能對話系統(tǒng)的分類
談到對話系統(tǒng)的目標(biāo),就不得不提及對話系統(tǒng)的分類。一般來說,人機(jī)交互的對話場景一共分為三大類別,分別是任務(wù)類對話,問答類對話,和閑聊類對話。這是目前業(yè)界比較公認(rèn)的方法,其依據(jù)是這三類對話系統(tǒng)背后所運(yùn)用到的核心技術(shù)與實(shí)現(xiàn)方法截然不同。
不過,在真實(shí)的應(yīng)用場景中,幾乎每款對話類產(chǎn)品都同時(shí)具備了上述提到的至少兩類對話系統(tǒng)的特征。目前市面上的對話系統(tǒng)往往同時(shí)具備解決任務(wù)的能力,回答問題的能力和閑聊的能力。因此我們不能單純的以這樣的分類方式為對話系統(tǒng)分別設(shè)計(jì)評測方法,而是跳出技術(shù)的實(shí)現(xiàn)框架,從應(yīng)用的角度尋找所有智能對話系統(tǒng)共同存在的特征,并以這些特征作為考量條件去設(shè)計(jì)評測方法。我將這些特征總結(jié)為話系統(tǒng)的對話情境,對話場景以及對話目的。
智能對話評測的考量條件 對話情境-上下文內(nèi)容
在對話系統(tǒng)中,回答內(nèi)容的好壞與上文的內(nèi)容有著直接的關(guān)聯(lián),在評價(jià)回答內(nèi)容的時(shí)候,最主要的一個(gè)限制條件就是上文問題的內(nèi)容。在評判一個(gè)對話系統(tǒng)生成答案好與壞的時(shí)候,測試者需要結(jié)合上文的內(nèi)容才能對答案作出比較公正和正確的判斷。這當(dāng)中不僅需要判斷當(dāng)前對話內(nèi)容的質(zhì)量,還涉及到對話所表達(dá)內(nèi)容邏輯的一致性與情感的合理性。上下文內(nèi)容對于多輪對話的生成起著至關(guān)重要的影響。一組對話內(nèi)容被放在不同的對話情境下會表現(xiàn)出皆然不同的效果。因此,在對一組對話內(nèi)容進(jìn)行評測時(shí),有必要充分理解其所在的對話情境。
對話場景 – 機(jī)器人扮演的角色
在不同的應(yīng)用場景下,對話系統(tǒng)需要扮演不同的角色以實(shí)現(xiàn)用戶特定的需求和意愿。目前比較主流的應(yīng)用場景包括家庭場景,早教場景,客服場景和車載場景。一個(gè)特定的場景下的對話內(nèi)容,總是包含特定的術(shù)語或套路,以及相關(guān)領(lǐng)域的知識庫或知識圖譜。這一類的對話往往可以返回一些約定俗成的回答或解決方案。在對對話系統(tǒng)進(jìn)行判定之前,測試人需要通過想象力將自己置身于該場景中。理解對話系統(tǒng)所嘗試扮演的角色,能夠幫助我們更加客觀的對其進(jìn)行評測。
對話目的 – 話題與意圖
在現(xiàn)實(shí)生活中,人與人的自然語言對話可分為兩大類,即有目的的對話和無目的的對話。有目的的對話可以根據(jù)提問者或主動發(fā)起對話者來引導(dǎo)當(dāng)前對話的目的。在對話結(jié)束時(shí),我們可以通過判斷目是否達(dá)成而判斷對話的質(zhì)量。然而,在實(shí)際對話過程中,對話的目的并不總是能夠被清晰的定義。在對話評測時(shí),我們不能只關(guān)心有明確目的的對話,而忽略無目的的對話。在無目的的對話內(nèi)容中依然會有信息的傳遞,和情感的交互。因此,無論對話內(nèi)容是否有明確的話題和意圖,我們都應(yīng)該關(guān)注其傳達(dá)的信息和情感。
對話系統(tǒng)的評測目標(biāo)
這些對話系統(tǒng)通用的考量條件,就是我們評判一個(gè)智能對話系統(tǒng)的先覺條件。當(dāng)明確了評判條件以后,我們就能給一組好的對話內(nèi)容進(jìn)行定義,以此來對一個(gè)智能對話系統(tǒng)進(jìn)行評測。
首先好的對話內(nèi)容應(yīng)該是符合語義情境的,上下文內(nèi)容應(yīng)該是緊密關(guān)聯(lián)的,并且是邏輯自洽的。接下來,好的對話內(nèi)容應(yīng)該可以滿足特定的應(yīng)用場景,對話的內(nèi)容表達(dá)是清晰明確的,同時(shí)切合用戶期待的。最后,無論話題是開放領(lǐng)域還是垂直領(lǐng)域的,無論意圖是達(dá)成還是未達(dá)成,好的對話內(nèi)容都應(yīng)該是具備的信息和情感的。
總結(jié)
至此,我們把如何評價(jià)一個(gè)智能對話系統(tǒng)的問題轉(zhuǎn)化如何定義一個(gè)好的智能對話系統(tǒng),并通過實(shí)際對話類產(chǎn)品在真實(shí)場景中的應(yīng)用情況,歸納出對話評測系統(tǒng)的考量條件與標(biāo)準(zhǔn)尺度。有了明確的尺度,智能對話評測的具體任務(wù)設(shè)計(jì)也就變得有章可循了。
一般來說,對話評估的工作主要從兩個(gè)方面進(jìn)行處理:自動評估和人工評估。我將在下一篇文章中介紹當(dāng)前主流的自動機(jī)器對話評測任務(wù),和人工標(biāo)注方法。我將分析這些任務(wù)和方法的不足之處,并闡述我自己是如何結(jié)合自動評測與人工標(biāo)注來設(shè)計(jì)智能對話評測方法的。
本文由 @單師傅 原創(chuàng)發(fā)布于人人都是產(chǎn)品經(jīng)理,未經(jīng)許可,禁止轉(zhuǎn)載
題圖來自 Unsplash ,基于 CC0 協(xié)議


