亚洲国产成人精品久久_欧美日韩国产综合一区二区_亚洲精品理论电影_色综合久久中文字幕

如何評測一個(gè)智能對話系統(tǒng)(一)

放大字體  縮小字體 發(fā)布日期:2019-11-24  來源:來自互聯(lián)網(wǎng)  作者:來自互聯(lián)網(wǎng)  瀏覽次數(shù):624
導(dǎo)讀

然而,智能對話系統(tǒng)的表現(xiàn)往往因不同的應(yīng)用場景和目標(biāo)而異,因此行業(yè)內(nèi)一直都沒有一個(gè)統(tǒng)一的對話質(zhì)量評測標(biāo)準(zhǔn)。無論對話內(nèi)容是否有明確的話題和意圖,我們都應(yīng)該關(guān)注其傳達(dá)的信息和情感。當(dāng)明確了評判條件以后,我們就能給…

本文從對話系統(tǒng)的分類介紹與評測目標(biāo)進(jìn)行分析,解釋了如何評測一個(gè)智能對話系統(tǒng)。

本文從對話系統(tǒng)的分類介紹與評測目標(biāo)進(jìn)行分析,解釋了如何評測一個(gè)智能對話系統(tǒng)。

自然語言對話作為新一代的人機(jī)交互媒介,已經(jīng)創(chuàng)建了廣泛的應(yīng)用程序。長期以來,研究人員一直在探索機(jī)器產(chǎn)生自然回復(fù)的不同方法,包括基于檢索的回復(fù),端到端的生成回復(fù),以及問答和推薦系統(tǒng)。 從智能家居設(shè)備到智能電話助手,從客戶服務(wù)到情感陪伴,我們周圍已經(jīng)出現(xiàn)了各式各樣的聊天機(jī)器人。 然而,智能對話系統(tǒng)的表現(xiàn)往往因不同的應(yīng)用場景和目標(biāo)而異,因此行業(yè)內(nèi)一直都沒有一個(gè)統(tǒng)一的對話質(zhì)量評測標(biāo)準(zhǔn)。

近年來,“如何評測一個(gè)智能對話系統(tǒng)”這個(gè)開放的問題引起了相關(guān)領(lǐng)域研究人員的極大關(guān)注。在過去的幾年時(shí)間里,我一直致力于探索智能對話系統(tǒng)的評測方法。由我設(shè)計(jì)的對話評測方法已經(jīng)在多款智能對話產(chǎn)品上得到驗(yàn)證,有效推動了產(chǎn)品的持續(xù)優(yōu)化和迭代。與此同時(shí),該評測方法被nlpcc2019選為開放域?qū)υ捪到y(tǒng)競賽的評測標(biāo)準(zhǔn),受到了領(lǐng)域?qū)<业恼J(rèn)可。

那么,對于這樣一個(gè)看似無解的問題,我是如何著手進(jìn)行設(shè)計(jì)的呢?

首先,對話評測是一個(gè)非常大的概念,它涉及到很多不同領(lǐng)域的知識,而且非常的主觀,無法用一個(gè)統(tǒng)一的標(biāo)準(zhǔn)評判。說白了,這個(gè)問題就是在評價(jià)一個(gè)人說話的水平,只不過被評價(jià)的對象是一個(gè)機(jī)器人。不過,這個(gè)事情也不是完全無章可循。我們可以通過聚焦和拆解的方法把這個(gè)大問題分成多個(gè)可量化的小問題。

事實(shí)上,想要有效的評測一個(gè)對話系統(tǒng),我們首先要知道被評測對話系統(tǒng)的目標(biāo)是什么。換句話說,就是我們期待對話系統(tǒng)給我們帶來什么樣的價(jià)值。只要明確了目標(biāo),我們就可以圍繞目標(biāo)建立標(biāo)準(zhǔn),再通過標(biāo)準(zhǔn)沿伸出評測的方法。

智能對話系統(tǒng)的分類

談到對話系統(tǒng)的目標(biāo),就不得不提及對話系統(tǒng)的分類。一般來說,人機(jī)交互的對話場景一共分為三大類別,分別是任務(wù)類對話,問答類對話,和閑聊類對話。這是目前業(yè)界比較公認(rèn)的方法,其依據(jù)是這三類對話系統(tǒng)背后所運(yùn)用到的核心技術(shù)與實(shí)現(xiàn)方法截然不同。

不過,在真實(shí)的應(yīng)用場景中,幾乎每款對話類產(chǎn)品都同時(shí)具備了上述提到的至少兩類對話系統(tǒng)的特征。目前市面上的對話系統(tǒng)往往同時(shí)具備解決任務(wù)的能力,回答問題的能力和閑聊的能力。因此我們不能單純的以這樣的分類方式為對話系統(tǒng)分別設(shè)計(jì)評測方法,而是跳出技術(shù)的實(shí)現(xiàn)框架,從應(yīng)用的角度尋找所有智能對話系統(tǒng)共同存在的特征,并以這些特征作為考量條件去設(shè)計(jì)評測方法。我將這些特征總結(jié)為話系統(tǒng)的對話情境,對話場景以及對話目的。

智能對話評測的考量條件 對話情境-上下文內(nèi)容

在對話系統(tǒng)中,回答內(nèi)容的好壞與上文的內(nèi)容有著直接的關(guān)聯(lián),在評價(jià)回答內(nèi)容的時(shí)候,最主要的一個(gè)限制條件就是上文問題的內(nèi)容。在評判一個(gè)對話系統(tǒng)生成答案好與壞的時(shí)候,測試者需要結(jié)合上文的內(nèi)容才能對答案作出比較公正和正確的判斷。這當(dāng)中不僅需要判斷當(dāng)前對話內(nèi)容的質(zhì)量,還涉及到對話所表達(dá)內(nèi)容邏輯的一致性與情感的合理性。上下文內(nèi)容對于多輪對話的生成起著至關(guān)重要的影響。一組對話內(nèi)容被放在不同的對話情境下會表現(xiàn)出皆然不同的效果。因此,在對一組對話內(nèi)容進(jìn)行評測時(shí),有必要充分理解其所在的對話情境。

對話場景 – 機(jī)器人扮演的角色

在不同的應(yīng)用場景下,對話系統(tǒng)需要扮演不同的角色以實(shí)現(xiàn)用戶特定的需求和意愿。目前比較主流的應(yīng)用場景包括家庭場景,早教場景,客服場景和車載場景。一個(gè)特定的場景下的對話內(nèi)容,總是包含特定的術(shù)語或套路,以及相關(guān)領(lǐng)域的知識庫或知識圖譜。這一類的對話往往可以返回一些約定俗成的回答或解決方案。在對對話系統(tǒng)進(jìn)行判定之前,測試人需要通過想象力將自己置身于該場景中。理解對話系統(tǒng)所嘗試扮演的角色,能夠幫助我們更加客觀的對其進(jìn)行評測。

對話目的 – 話題與意圖

在現(xiàn)實(shí)生活中,人與人的自然語言對話可分為兩大類,即有目的的對話和無目的的對話。有目的的對話可以根據(jù)提問者或主動發(fā)起對話者來引導(dǎo)當(dāng)前對話的目的。在對話結(jié)束時(shí),我們可以通過判斷目是否達(dá)成而判斷對話的質(zhì)量。然而,在實(shí)際對話過程中,對話的目的并不總是能夠被清晰的定義。在對話評測時(shí),我們不能只關(guān)心有明確目的的對話,而忽略無目的的對話。在無目的的對話內(nèi)容中依然會有信息的傳遞,和情感的交互。因此,無論對話內(nèi)容是否有明確的話題和意圖,我們都應(yīng)該關(guān)注其傳達(dá)的信息和情感。

對話系統(tǒng)的評測目標(biāo)

這些對話系統(tǒng)通用的考量條件,就是我們評判一個(gè)智能對話系統(tǒng)的先覺條件。當(dāng)明確了評判條件以后,我們就能給一組好的對話內(nèi)容進(jìn)行定義,以此來對一個(gè)智能對話系統(tǒng)進(jìn)行評測。

首先好的對話內(nèi)容應(yīng)該是符合語義情境的,上下文內(nèi)容應(yīng)該是緊密關(guān)聯(lián)的,并且是邏輯自洽的。接下來,好的對話內(nèi)容應(yīng)該可以滿足特定的應(yīng)用場景,對話的內(nèi)容表達(dá)是清晰明確的,同時(shí)切合用戶期待的。最后,無論話題是開放領(lǐng)域還是垂直領(lǐng)域的,無論意圖是達(dá)成還是未達(dá)成,好的對話內(nèi)容都應(yīng)該是具備的信息和情感的。

總結(jié)

至此,我們把如何評價(jià)一個(gè)智能對話系統(tǒng)的問題轉(zhuǎn)化如何定義一個(gè)好的智能對話系統(tǒng),并通過實(shí)際對話類產(chǎn)品在真實(shí)場景中的應(yīng)用情況,歸納出對話評測系統(tǒng)的考量條件與標(biāo)準(zhǔn)尺度。有了明確的尺度,智能對話評測的具體任務(wù)設(shè)計(jì)也就變得有章可循了。

一般來說,對話評估的工作主要從兩個(gè)方面進(jìn)行處理:自動評估和人工評估。我將在下一篇文章中介紹當(dāng)前主流的自動機(jī)器對話評測任務(wù),和人工標(biāo)注方法。我將分析這些任務(wù)和方法的不足之處,并闡述我自己是如何結(jié)合自動評測與人工標(biāo)注來設(shè)計(jì)智能對話評測方法的。

本文由 @單師傅 原創(chuàng)發(fā)布于人人都是產(chǎn)品經(jīng)理,未經(jīng)許可,禁止轉(zhuǎn)載

題圖來自 Unsplash ,基于 CC0 協(xié)議

 
 
免責(zé)聲明
本文為會員免費(fèi)發(fā)布,僅代表發(fā)布者個(gè)人觀點(diǎn),本站未對其內(nèi)容進(jìn)行核實(shí),請讀者僅做參考,如若文中涉及有違公德、觸犯法律的內(nèi)容,一經(jīng)發(fā)現(xiàn),立即刪除,作者需自行承擔(dān)相應(yīng)責(zé)任。涉及到版權(quán)或其他問題,請及時(shí)聯(lián)系我們刪除處理。
 
 
主站蜘蛛池模板: 欧美日韩免费精品| 国产精品麻豆免费版| 久久亚洲精品视频| 日韩欧美视频网站| 国产精品视频最多的网站| 日本精品一区二区三区高清 久久 日本精品久久久久中文字幕 | 日韩中文字幕网站| 国模精品娜娜一二三区| 欧美精品一区在线| 日韩精品福利视频| 日本一区二区视频| 中文字幕日韩一区二区三区不卡| 亚洲伊人婷婷| 丝袜美腿亚洲一区二区| 九九精品在线播放| 91高清免费视频| 国产精品无av码在线观看| 日韩中文字幕国产精品| 亚洲五月六月| 国产在线精品自拍| 精品久久久久久无码中文野结衣| 中文字幕一区二区三区最新| 久久精品亚洲精品| 欧美日韩一区在线视频| 欧洲国产精品| 国产成人精品av在线| 青青久久av北条麻妃海外网| 久久99国产综合精品女同| 日本视频一区二区在线观看| 亚洲午夜精品久久久中文影院av| 国产成人综合一区二区三区| 国产精品91在线| 亚洲一区二区三区在线观看视频 | 国产不卡在线观看| 国产高清自拍99| 亚洲人成网站在线观看播放| 视频一区二区三区免费观看| 日韩在线视频观看| 欧美最猛黑人xxxx黑人猛叫黄| 欧美久久久精品| 九九精品在线视频|