亚洲国产成人精品久久_欧美日韩国产综合一区二区_亚洲精品理论电影_色综合久久中文字幕

機(jī)器人強(qiáng)化遷移學(xué)習(xí)指南_架設(shè)模擬和現(xiàn)實(shí)的橋梁

放大字體  縮小字體 發(fā)布日期:2019-12-26  來源:來自互聯(lián)網(wǎng)  作者:來自互聯(lián)網(wǎng)  瀏覽次數(shù):270
導(dǎo)讀

強(qiáng)化學(xué)習(xí)需要與現(xiàn)實(shí)環(huán)境進(jìn)行大量的交互,但是機(jī)器人強(qiáng)化學(xué)習(xí)從現(xiàn)實(shí)環(huán)境中獲取樣本的代價(jià)極高,因此,針對復(fù)雜運(yùn)動技能的機(jī)器人強(qiáng)化學(xué)習(xí)是一個(gè)具有挑戰(zhàn)性且尚未解決的問題,而遷移學(xué)習(xí)是實(shí)現(xiàn)物理機(jī)器人強(qiáng)化學(xué)習(xí)的重要策略。機(jī)…

機(jī)器之心原創(chuàng)

作者:仵冀穎

編輯:Joni

近年來,強(qiáng)化學(xué)習(xí)在人工智能領(lǐng)域中所表現(xiàn)出來的成果多數(shù)是在仿真、視頻游戲等非物理環(huán)境中實(shí)現(xiàn)的,然而在物理系統(tǒng)傷的復(fù)雜策略仍存在很大的挑戰(zhàn)。這篇文章聚焦的是如何利用遷移學(xué)習(xí),使強(qiáng)化學(xué)習(xí)能夠在模擬環(huán)境中進(jìn)行訓(xùn)練,而在實(shí)際的物理機(jī)器人領(lǐng)域中得到應(yīng)用。

近年來,強(qiáng)化學(xué)習(xí)在人工智能領(lǐng)域中所表現(xiàn)出來的成果多數(shù)是在仿真、視頻游戲等非物理環(huán)境中實(shí)現(xiàn)的,然而在物理系統(tǒng)傷的復(fù)雜策略仍存在很大的挑戰(zhàn)。這篇文章聚焦的是如何利用遷移學(xué)習(xí),使強(qiáng)化學(xué)習(xí)能夠在模擬環(huán)境中進(jìn)行訓(xùn)練,而在實(shí)際的物理機(jī)器人領(lǐng)域中得到應(yīng)用。

近年來,強(qiáng)化學(xué)習(xí)(Reinforcement learning)在人工智能領(lǐng)域中表現(xiàn)出了顯著的性能,例如基于原始像素的 Atari 游戲,連續(xù)復(fù)雜控制策略的學(xué)習(xí),以及在圍棋游戲 Go 中超越人類的表現(xiàn)等。

然而,這些成功大多是在仿真、視頻游戲等非物理環(huán)境中實(shí)現(xiàn)的,強(qiáng)化學(xué)習(xí)在物理系統(tǒng)上的復(fù)雜策略仍存在很大的挑戰(zhàn)。強(qiáng)化學(xué)習(xí)需要與現(xiàn)實(shí)環(huán)境進(jìn)行大量的交互,但是機(jī)器人強(qiáng)化學(xué)習(xí)從現(xiàn)實(shí)環(huán)境中獲取樣本的代價(jià)極高,因此,針對復(fù)雜運(yùn)動技能的機(jī)器人強(qiáng)化學(xué)習(xí)是一個(gè)具有挑戰(zhàn)性且尚未解決的問題,而遷移學(xué)習(xí)是實(shí)現(xiàn)物理機(jī)器人強(qiáng)化學(xué)習(xí)的重要策略。

本文聚焦如何利用遷移學(xué)習(xí),使強(qiáng)化學(xué)習(xí)能夠在模擬環(huán)境中進(jìn)行訓(xùn)練,而在實(shí)際的物理機(jī)器人領(lǐng)域中得到應(yīng)用。

機(jī)器人的強(qiáng)化遷移學(xué)習(xí)背景介紹

機(jī)器之心在之前的文章中對一般的強(qiáng)化遷移學(xué)習(xí)進(jìn)行過梳理,我們首先來 回顧一下 :

強(qiáng)化學(xué)習(xí)是一種根據(jù)環(huán)境反饋進(jìn)行學(xué)習(xí)的技術(shù)。強(qiáng)化學(xué)習(xí) agent 辨別自身所處的狀態(tài) (state),按照某種策略決定動作(action),并根據(jù)環(huán)境提供的獎(jiǎng)賞來調(diào)整策略,直至達(dá)到最優(yōu)。

馬爾可夫決策 MDP(Markov Decision Process)是強(qiáng)化學(xué)習(xí)任務(wù)的標(biāo)準(zhǔn)描述,我們定義一個(gè)任務(wù) M,用四元組< S , A , T, R>表示,其中 S 是狀態(tài)空間,A 是動作空間,T 是狀態(tài)轉(zhuǎn)移概率,R 是獎(jiǎng)賞函數(shù)。state-action 空間 S×A 定義了任務(wù)的域,狀態(tài)轉(zhuǎn)移概率 T 和獎(jiǎng)賞函數(shù) R 定義了任務(wù)的目標(biāo)。

強(qiáng)化學(xué)習(xí)是一種根據(jù)環(huán)境反饋進(jìn)行學(xué)習(xí)的技術(shù)。強(qiáng)化學(xué)習(xí) agent 辨別自身所處的狀態(tài) (state),按照某種策略決定動作(action),并根據(jù)環(huán)境提供的獎(jiǎng)賞來調(diào)整策略,直至達(dá)到最優(yōu)。

馬爾可夫決策 MDP(Markov Decision Process)是強(qiáng)化學(xué)習(xí)任務(wù)的標(biāo)準(zhǔn)描述,我們定義一個(gè)任務(wù) M,用四元組< S , A , T, R>表示,其中 S 是狀態(tài)空間,A 是動作空間,T 是狀態(tài)轉(zhuǎn)移概率,R 是獎(jiǎng)賞函數(shù)。state-action 空間 S×A 定義了任務(wù)的域,狀態(tài)轉(zhuǎn)移概率 T 和獎(jiǎng)賞函數(shù) R 定義了任務(wù)的目標(biāo)。

當(dāng)強(qiáng)化學(xué)習(xí)的狀態(tài)動作空間 S×A 很大時(shí),為了尋找最優(yōu)策略,搜索過程非常耗時(shí)。此外,學(xué)習(xí)近似最優(yōu)解所需的樣本數(shù)量在實(shí)際問題中往往令人望而卻步。無論是基于值的方法還是基于策略的方法,只要問題稍稍變動,之前的學(xué)習(xí)結(jié)果就會失效,而重新訓(xùn)練的代價(jià)巨大。因此,研究者們針對強(qiáng)化學(xué)習(xí)中的遷移學(xué)習(xí)展開了研究,希望能夠?qū)⒅R從源任務(wù)遷移到目標(biāo)任務(wù)以改善性能。

當(dāng)強(qiáng)化學(xué)習(xí)的狀態(tài)動作空間 S×A 很大時(shí),為了尋找最優(yōu)策略,搜索過程非常耗時(shí)。此外,學(xué)習(xí)近似最優(yōu)解所需的樣本數(shù)量在實(shí)際問題中往往令人望而卻步。無論是基于值的方法還是基于策略的方法,只要問題稍稍變動,之前的學(xué)習(xí)結(jié)果就會失效,而重新訓(xùn)練的代價(jià)巨大。因此,研究者們針對強(qiáng)化學(xué)習(xí)中的遷移學(xué)習(xí)展開了研究,希望能夠?qū)⒅R從源任務(wù)遷移到目標(biāo)任務(wù)以改善性能。

上文中提到的樣本數(shù)量、學(xué)習(xí)結(jié)果針對不同任務(wù)失效等這些在一般強(qiáng)化學(xué)習(xí)中存在的問題在機(jī)器人強(qiáng)化學(xué)習(xí)中尤其突出。現(xiàn)有的機(jī)器人強(qiáng)化學(xué)習(xí)方法大多只能完成單個(gè)任務(wù),而無法在不同的任務(wù)之間推廣,或者僅通過收集很少數(shù)量的現(xiàn)實(shí)機(jī)器人經(jīng)驗(yàn)來概括一些任務(wù)策略,其性能無法滿足實(shí)戰(zhàn)的要求。將遷移學(xué)習(xí)引入機(jī)器人強(qiáng)化學(xué)習(xí),目的是利用模擬環(huán)境中的數(shù)據(jù)輔助現(xiàn)實(shí)機(jī)器人學(xué)習(xí)。機(jī)器人強(qiáng)化學(xué)習(xí)中的遷移學(xué)習(xí)稱為「模擬到現(xiàn)實(shí)(Sim-to-real)方法」,具體是指首先在模擬環(huán)境中收集數(shù)據(jù)并訓(xùn)練機(jī)器人控制策略,然后進(jìn)行遷移學(xué)習(xí),將訓(xùn)練獲得的控制策略(新技能)應(yīng)用于物理現(xiàn)實(shí)中的機(jī)器人。

然而,機(jī)器人的強(qiáng)化遷移學(xué)習(xí)也并不容易,因?yàn)椴⒉淮嬖谀軌蛲昝啦蹲浆F(xiàn)實(shí)的模擬器(環(huán)境),模擬與現(xiàn)實(shí)之間存在「現(xiàn)實(shí)差距」(Reality Gap),模型的輸入分布在策略訓(xùn)練(模擬)和策略執(zhí)行(現(xiàn)實(shí))之間存在動態(tài)變化和差異性。如果繼續(xù)在這種有缺陷的模擬環(huán)境中訓(xùn)練策略產(chǎn)生控制行為,這種行為無法應(yīng)對現(xiàn)實(shí)環(huán)境中的任何微小變化。此外,對于一些機(jī)器人動作模擬問題(如滑動摩擦力和接觸力),其背后的物理現(xiàn)象仍然沒有在模擬器上百分百模擬,這就意味著根本不可能在模擬環(huán)境中對一些現(xiàn)實(shí)中的機(jī)器人動作進(jìn)行完全精確的模擬。

目前,改進(jìn)機(jī)器人的強(qiáng)化遷移學(xué)習(xí)主要有幾類方法:

1、試圖在模擬和現(xiàn)實(shí)之間建立明確的一致性,縮小模擬和現(xiàn)實(shí)的差距;

3、在模擬階段得到一個(gè)足夠好的策略,能夠在現(xiàn)實(shí)的機(jī)器人策略執(zhí)行過程中快速適應(yīng)現(xiàn)實(shí)世界;

4、提高對機(jī)器人動作物理現(xiàn)象本身的模擬水平;

5、可以通過引入其他學(xué)習(xí)手段提升機(jī)器人強(qiáng)化遷移學(xué)習(xí)的效果。

本文對機(jī)器人強(qiáng)化遷移學(xué)習(xí)的最新進(jìn)展進(jìn)行了梳理,對不同的方法進(jìn)行了簡要分析。

機(jī)器人的強(qiáng)化遷移學(xué)習(xí)最新進(jìn)展

1、縮小模擬和現(xiàn)實(shí)的差距

Florian Golemo, Adrien Ali Taiga, et al, 「Sim-to-Real Transfer with Neural-Augmented Robot Simulation,」PMLR 2018,

Available: proceedings.mlr.press/v87/golemo18a/golemo18a.pdf

在大部分機(jī)器人模擬器中,只能通過有限的參數(shù)對物理環(huán)境進(jìn)行模擬,因此與現(xiàn)實(shí)情況對比總有誤差。這篇文章提出,使用從現(xiàn)實(shí)機(jī)器人中收集的數(shù)據(jù)訓(xùn)練一個(gè)遞歸神經(jīng)網(wǎng)絡(luò)來預(yù)測模擬和現(xiàn)實(shí)世界之間的差距,經(jīng)過訓(xùn)練縮小該誤差,從而提升機(jī)器人強(qiáng)化遷移學(xué)習(xí)的效果,稱為:神經(jīng)增強(qiáng)模擬(Neural-Augmented Simulation,NAS)。NAS 可以與不同強(qiáng)化學(xué)習(xí)算法相結(jié)合,在保證快速離線訓(xùn)練的同時(shí),較好的學(xué)習(xí)遷移策略。為了有效捕獲狀態(tài)(state)中不滿足標(biāo)準(zhǔn)馬爾可夫假設(shè)的偏差,本文引入遞歸神經(jīng)網(wǎng)絡(luò)進(jìn)行學(xué)習(xí),以 LSTM 為例具體介紹。

針對強(qiáng)化學(xué)習(xí)中的馬爾可夫決策 MDP,假設(shè)源域(模擬環(huán)境)和目標(biāo)域(現(xiàn)實(shí)環(huán)境)具有相同的動作(action),兩個(gè)域中的任務(wù)分別為 Ds=< S_s , A , p_s, r_s>和 Dt=< S_t , A , p_t, r_t>,假設(shè)獎(jiǎng)賞相同(即 r_s=r_t),同時(shí)假設(shè)有權(quán)訪問源域并可將其重置為特定的狀態(tài)。作者利用 LSTM 建立一個(gè)源域和目標(biāo)域之間的差距模型,學(xué)習(xí)從源域中的軌跡到目標(biāo)域中軌跡的映射,通過使源域中的模擬對象逼近目標(biāo)域中現(xiàn)實(shí)機(jī)器人的軌跡來提高模擬的質(zhì)量,從而縮小模擬和現(xiàn)實(shí)的差距。給定行為策略μ(可以是隨機(jī)的或由專家提供),從目標(biāo)域中收集現(xiàn)實(shí)機(jī)器人的軌跡。

從目標(biāo)域分布中采樣初始狀態(tài) s_0~p_t(s_0),源域也從相同的初始狀態(tài)開始訓(xùn)練。在每個(gè)學(xué)習(xí)過程中,根據(jù)行為策略 a_i~μ(s_t) 對操作進(jìn)行采樣,在兩個(gè)域中分別處理并進(jìn)行遷移學(xué)習(xí),將源域重置為目標(biāo)域狀態(tài),重復(fù)該過程,直到結(jié)束。最終得到的行為軌跡為:

在從現(xiàn)實(shí)機(jī)器人中收集數(shù)據(jù)之后,使用訓(xùn)練模型φ(LSTM)來預(yù)測目標(biāo)域中 s_{i+1} 的值。通常來說,兩個(gè)域狀態(tài)之間的差距很小,計(jì)算網(wǎng)絡(luò)輸出校正項(xiàng)為:

其中 h 是網(wǎng)絡(luò)的隱藏狀態(tài)。

訓(xùn)練得到模型φ后,將其與模擬環(huán)境相結(jié)合,以學(xué)習(xí)稍后將遷移到現(xiàn)實(shí)目標(biāo)環(huán)境的策略。本文選擇 PPO[1] 作為強(qiáng)化學(xué)習(xí)的方法,在每個(gè)學(xué)習(xí)過程中,將源域中的當(dāng)前狀態(tài)遷移至模型φ,計(jì)算目標(biāo)環(huán)境中對當(dāng)前狀態(tài)的估計(jì),根據(jù)該估計(jì)值選擇動作:

然后將源域狀態(tài)設(shè)置為目標(biāo)域狀態(tài)的當(dāng)前估計(jì)值,從而允許模型修正來自源域的軌跡,使它們更接近目標(biāo)域中的相應(yīng)軌跡,以縮小兩個(gè)域之間的差距。

本文與如下幾種方法進(jìn)行實(shí)驗(yàn)對比:

1、forward 模型策略:使用 LSTM 和從目標(biāo)域收集的數(shù)據(jù)訓(xùn)練前向動態(tài)模型,然后僅使用此模型訓(xùn)練策略(沒有來自源域的軌跡調(diào)整);

2、專家策略: 直接在目標(biāo)域內(nèi)訓(xùn)練;

3、源策略:直接將在源域中訓(xùn)練得到的策略應(yīng)用于目標(biāo)域,而不進(jìn)行任何自適應(yīng)處理;

4、傳輸策略:使用 NAS 訓(xùn)練的策略。

圖 1. 不同方法的效果對比

圖 1 給出不同方法的實(shí)驗(yàn)效果。圖 1(a):比較每種方法給出 3 個(gè)策略的 20 次獎(jiǎng)賞平均值。圖 1(b):在模擬(綠色虛線)、現(xiàn)實(shí)機(jī)器人(藍(lán)色實(shí)線)上接收目標(biāo)位置(紫色虛線)時(shí)的單關(guān)節(jié)行為比較,以及根據(jù) forward 模型(紅色虛線)和本文提出方法(黃色虛線)進(jìn)行估計(jì)的結(jié)果。

本文使用 Popy Ergo Jr 機(jī)器人手臂進(jìn)行實(shí)驗(yàn),將兩個(gè)機(jī)器人固定在一塊木板上,兩個(gè)機(jī)器人面朝對方,兩個(gè)機(jī)頭在靜止位置相隔 5 毫米。一個(gè)機(jī)器人拿著一把「劍」(鉛筆),另一個(gè)拿著一個(gè)盾牌。護(hù)盾機(jī)器人(「防御者」)每 2.5 秒移動一次,移動到一個(gè)任意位置,在該位置護(hù)盾在對手可觸及的范圍內(nèi)。劍形機(jī)器人(「攻擊者」)是唯一可直接控制的機(jī)器人。每一個(gè)工作段(episode)持續(xù) 10 秒,攻擊者的目標(biāo)是盡可能頻繁地觸摸盾牌。

圖 1(a) 中結(jié)果顯示專家策略(直接在現(xiàn)實(shí)機(jī)器人中訓(xùn)練的策略)的效果最差,其主要原因是,在這篇文章所述的實(shí)驗(yàn)條件下:

(a)在現(xiàn)實(shí)環(huán)境中的命中檢測并不完美(該現(xiàn)象與在模擬中類似),并且由于不是每一次命中都能夠成功檢測到,因此得到的獎(jiǎng)賞非常稀疏。

(b)由于攻擊者機(jī)器人經(jīng)常將劍卡在對手身上、自己身上或環(huán)境中,因此在某些任務(wù)中從現(xiàn)實(shí)環(huán)境找到并提取機(jī)器人狀態(tài)和動作并不像模擬中那么容易。此外,源策略和 forward 模型策略的效果差不多,而使用 NAS 訓(xùn)練的傳輸策略效果最優(yōu)。

圖 1(b) 給出了對于一個(gè)給定任務(wù)不同方法估計(jì)關(guān)節(jié)位置的準(zhǔn)確度差異。盡管 forward 模型能夠很好的估計(jì)從目標(biāo)域中收集的數(shù)據(jù),但由于沒有根據(jù)源域的軌跡進(jìn)行任何調(diào)整,僅使用 forward 模型訓(xùn)練得到的策略效果較差。出現(xiàn)這樣的問題是由于 forward 模型過度擬合訓(xùn)練數(shù)據(jù),而不能夠很好的推廣到其他情況。而能夠有效避免這一問題也是本文提出方法的一個(gè)關(guān)鍵優(yōu)勢:NAS 通過引入神經(jīng)網(wǎng)絡(luò)來增強(qiáng)學(xué)習(xí),能夠有效利用來源于不同任務(wù)的學(xué)習(xí)增強(qiáng)信息,從而提升策略水平。

2、隨機(jī)化處理策略訓(xùn)練

X. Peng, M. Andrychowicz, W. Zaremba, and P . Abbeel,「Sim-to-real transfer of robotic control with dynamics randomization,」CoRR, 2017.

Available: https://arxiv.org/pdf/1710.06537v3.pdf

機(jī)器人的強(qiáng)化遷移學(xué)習(xí)基于模擬環(huán)境中豐富的樣本數(shù)據(jù)來訓(xùn)練 agent。經(jīng)典算法一般基于固定的動態(tài)模型訓(xùn)練,例如上一篇文章中介紹的是基于確定的狀態(tài)和動作完成訓(xùn)練的。這種情況下經(jīng)常會導(dǎo)致 Reality Gap 的問題。這篇文章提出來的思路是通過隨機(jī)化處理狀態(tài)和動作,訓(xùn)練得到動態(tài)的、高適應(yīng)性的策略,從而實(shí)現(xiàn)在現(xiàn)實(shí)物理系統(tǒng)中應(yīng)用策略,不需要再進(jìn)行任何訓(xùn)練或調(diào)整就能有效應(yīng)對現(xiàn)實(shí)世界中的動態(tài)變化。

首先,引入一組動態(tài)參數(shù)μ,用于表征模擬場景的動態(tài)變化概率 p(s_{t+1} | s_t, a_t, μ)。策略訓(xùn)練的目標(biāo)是最大化動態(tài)參數(shù)分布的期望值 E:

基于動態(tài)參數(shù)訓(xùn)練得到的策略能夠更好的滿足現(xiàn)實(shí)環(huán)境中的動態(tài)情況推廣要求。具體的,文章選擇以一個(gè) 7 自由度的取物機(jī)器人手臂在一個(gè)推球任務(wù)中的訓(xùn)練為例介紹隨機(jī)化策略。明確每個(gè)階段(episode)的目標(biāo)「g」為將冰球移動到桌面的隨機(jī)目標(biāo)位置。機(jī)器人及模擬場景見圖 2。

圖 2. 推球任務(wù)機(jī)器人及模擬 MuJoCo 模型

首先,確定狀態(tài)和動作。使用手臂的關(guān)節(jié)位置和速度、抓取器的位置以及冰球的位置、方向、線速度和角速度等來表示狀態(tài),生成一個(gè) 52 維的狀態(tài)空間;觀測噪聲對傳感器中的不確定性進(jìn)行建模,并作為獨(dú)立的高斯噪聲應(yīng)用于每個(gè)狀態(tài)特征。動作由指定位置控制器的目標(biāo)關(guān)節(jié)角度來表示,目標(biāo)角度指定為相對于當(dāng)前關(guān)節(jié)旋轉(zhuǎn)的相對偏移,生成一個(gè) 7 維動作空間。

第二,對模擬 MuJoCo 模型中的狀態(tài)和動作進(jìn)行隨機(jī)化處理,從而產(chǎn)生更多訓(xùn)練樣本。在本文的示例場景中具體包括:機(jī)器人身體各環(huán)節(jié)的質(zhì)量、各關(guān)節(jié)阻尼、冰球的質(zhì)量摩擦和阻尼、桌子的高度、位置控制器增益、動作間隔時(shí)間,以及觀測噪聲。總共包含了 95 個(gè)隨機(jī)參數(shù)。

第三,制定適應(yīng)性策略。雖然動態(tài)參數(shù)μ在模擬環(huán)境中很容易獲得,但對于部署在現(xiàn)實(shí)環(huán)境中的策略未必適用。為了彌補(bǔ)它們之間的誤差,引入一個(gè)在線系統(tǒng)識別模塊φ(s_t,h_t)=μ,該模塊利用狀態(tài)和動作的歷史情況 h_t=[a_t-1,s_t-1,a_t-2,s_t-2,…] 來預(yù)測動態(tài)參數(shù)μ。然后,將預(yù)測的參數(shù)用作通用策略的輸入,該策略根據(jù)當(dāng)前狀態(tài)和推斷的動態(tài)參數(shù)π(a_t | s_t,μ) 對操作進(jìn)行采樣。關(guān)于歷史狀態(tài)μ的計(jì)算方式不是本文討論的重點(diǎn),詳細(xì)內(nèi)容可參照 [2]。

使用遞歸模型π(a_t | s_t, z_t, g) 將動態(tài)參數(shù)嵌入到策略中,其中 z_t=z(h_t) 表征過去的狀態(tài)和動作,從而提供策略用于推斷系統(tǒng)動態(tài)變化的機(jī)制。

第四,完成策略訓(xùn)練。在策略訓(xùn)練過程中,通過獎(jiǎng)賞函數(shù)的設(shè)計(jì)保證 agent 完成任務(wù)目標(biāo)。這篇文章使用 Hindsight Experience Relay(HER)基于稀疏獎(jiǎng)賞函數(shù)訓(xùn)練策略 [3],具體為:考慮軌跡τ,目標(biāo) g 在軌跡調(diào)整的過程中始終不滿足,因此每一步的獎(jiǎng)賞值為-1。一旦確定新目標(biāo) g』,就可以計(jì)算原始軌跡的獎(jiǎng)賞在新目標(biāo)下的軌跡。與 g』相關(guān)的獎(jiǎng)賞不再是-1。使用 HER 替代過去的經(jīng)歷,可以使用比原始記錄軌跡更好的樣本來訓(xùn)練 agent。

此外,這篇文章還引入一個(gè)適合于連續(xù)控制的循環(huán)確定性策略梯度(Recurrent Deterministic Policy Gradient,RDPG)實(shí)現(xiàn)強(qiáng)化學(xué)習(xí)。具體做法是:將遞歸價(jià)值函數(shù)建模為 Q(s_t, a_t, y_t, g, μ),其中 y_t= y(h_t)。價(jià)值函數(shù)僅在訓(xùn)練期間使用,并且已知模擬器的動態(tài)參數(shù)μ,使用μ作為價(jià)值函數(shù)的附加輸入,而不是策略的附加輸入。

圖 3 給出了策略(π)和價(jià)值(Q)網(wǎng)絡(luò)的結(jié)構(gòu)圖示,其中輸入為當(dāng)前狀態(tài) s_t 和前一個(gè)動作 a_t-1。策略(π)網(wǎng)絡(luò)架構(gòu)如下:每個(gè)網(wǎng)絡(luò)由一個(gè)前饋分支和一個(gè)遞歸分支組成,后者的任務(wù)是從過去觀測值推斷動態(tài)參數(shù)。內(nèi)部存儲器使用一層 LSTM 單元建模,并且僅提供推斷動態(tài)參數(shù)所需的信息(例如,s_t 和 a_t-1)。由于目標(biāo) g 在每個(gè)階段都是確定的,因此不包含任何有關(guān)的動態(tài)信息(時(shí)序信息),因此僅由前饋分支處理。此外,由于當(dāng)前狀態(tài)對于確定當(dāng)前時(shí)間步長特別重要,因此還向前饋分支提供一個(gè)副本作為輸入。然后,將兩個(gè)分支計(jì)算的特征連接起來,由兩個(gè)附加的全連接層(每個(gè)層 128 個(gè)單元)進(jìn)行處理。價(jià)值(Q)網(wǎng)絡(luò)整體架構(gòu)類似。

圖 3. 策略和價(jià)值網(wǎng)絡(luò)的結(jié)構(gòu)圖示

在這篇文章以及我們上面介紹的神經(jīng)增強(qiáng)模擬(NAS)方法中都提到了遞歸神經(jīng)網(wǎng)絡(luò)(LSTM)的使用。其中,NAS 使用 LSTM 建立源域和目標(biāo)域之間的差距模型,在每個(gè)學(xué)習(xí)過程中,將源域中的當(dāng)前狀態(tài)遷移至 LSTM 模型,計(jì)算目標(biāo)環(huán)境中對當(dāng)前狀態(tài)的估計(jì),根據(jù)該估計(jì)值選擇動作:然后將源域狀態(tài)設(shè)置為目標(biāo)域狀態(tài)的當(dāng)前估計(jì)值,從而允許模型修正來自源域的軌跡,使它們更接近目標(biāo)域中的相應(yīng)軌跡,以縮小兩個(gè)域之間的差距。而在本文中,引入 LSTM 是作為強(qiáng)化學(xué)習(xí)策略訓(xùn)練網(wǎng)絡(luò)結(jié)構(gòu)的內(nèi)部存儲器使用。

文章最后給出了實(shí)驗(yàn)對比,評估了不同模型在模擬和真實(shí) Fetch arm 上部署的性能,分別為:使用圖 3 中結(jié)構(gòu)的 LSTM、一種只接受當(dāng)前狀態(tài)作為輸入的無記憶的前饋網(wǎng)絡(luò)(FF)、無記憶無隨機(jī)化前饋網(wǎng)絡(luò)(FF-no-Rand)、增加了 8 個(gè)先前觀察到的狀態(tài)和動作的歷史輸入的前饋網(wǎng)絡(luò)(FF+Hist)。圖 4 為不同模型在模擬和現(xiàn)實(shí)機(jī)器人上完成推送任務(wù)的性能,只使用模擬數(shù)據(jù)訓(xùn)練策略。LSTM 與 FF+Hist 在模擬環(huán)境中效果相當(dāng),但 LSTM 能夠更好地適應(yīng)動態(tài)變化的物理系統(tǒng)(現(xiàn)實(shí)機(jī)器人),而未經(jīng)隨機(jī)訓(xùn)練的前饋網(wǎng)絡(luò)(FF-no-Rand)則根本無法在現(xiàn)實(shí)機(jī)器人的動態(tài)環(huán)境中執(zhí)行任務(wù)。

圖 4. 不同模型在模擬和現(xiàn)實(shí)機(jī)器人上進(jìn)行推送任務(wù)時(shí)的性能對比

3、直接提高策略質(zhì)量

Zhanpeng He, Ryan Julian, et al,「Zero-Shot Skill Composition and Simulation-to-Real Transfer by Learning Task Representations,」

Avaiable: https://arxiv.org/pdf/1810.02422.pdf

這篇文章提出的方法試圖在模擬環(huán)境中學(xué)習(xí)一個(gè)能夠快速適應(yīng)現(xiàn)實(shí)世界的健壯的策略。文章的基本思想是:利用強(qiáng)化學(xué)習(xí)和變分推理學(xué)習(xí)技能的嵌入空間,之后將這些技能在真實(shí)機(jī)器人上轉(zhuǎn)移和組合實(shí)現(xiàn)。通過引入模型預(yù)測控制(Model-Predictive Control,MPC)學(xué)習(xí)任務(wù)表示,實(shí)現(xiàn)了在現(xiàn)實(shí)機(jī)器人中不經(jīng)微調(diào)處理即可成功的完成未知任務(wù),從而使得遷移過程更加健壯,能夠顯著減少訓(xùn)練策略所需的仿真樣本數(shù),從而得到相關(guān)任務(wù)的策略。MPC 是直接利用學(xué)習(xí)到的潛在空間和模擬來尋找新任務(wù)的在線策略。

該方法包括四個(gè)關(guān)鍵部分:變分推理、策略梯度強(qiáng)化學(xué)習(xí)、模型預(yù)測控制(MPC)和物理模擬。其中,使用變分推理 (variational inference) 來學(xué)習(xí)一個(gè)低維的技能潛在空間,使用強(qiáng)化學(xué)習(xí)同時(shí)學(xué)習(xí)以這些潛在技能為條件的控制策略。而由于對于給定的潛在技能,策略的精確長時(shí)間行為很難預(yù)測,因此在實(shí)際機(jī)器人上執(zhí)行之前,使用 MPC 和在線仿真來評估模擬中的潛在技能計(jì)劃。

變分推理

在多任務(wù)設(shè)置中,使用 T={1,...,N} 預(yù)先定義一組低級技能,以及每項(xiàng)技能的獎(jiǎng)賞函數(shù) r(s,a)。除了像經(jīng)典強(qiáng)化學(xué)習(xí)方法中學(xué)習(xí)低級技能策略π_θ,作者提出使用類似變分推理的辦法再學(xué)習(xí)一個(gè)嵌入函數(shù) p_φ。使用一個(gè)潛在變量 z 參數(shù)化低級技能庫,而真正的技能標(biāo)識 t 包含在嵌入函數(shù) p_φ的策略中。也就是說,并不以顯示 ID 的方式直接向策略給出技能 ID,而是通過隨機(jī)嵌入函數(shù) p_φ將編碼為獨(dú)熱向量(one-hot vector)的技能 ID t 輸入到策略中,生成一個(gè)潛在向量(latent variable)z。將這個(gè)相同的 z 值輸入到整個(gè)策略中,以便軌跡中的所有步驟都與相同的 z 值相關(guān)聯(lián)。

其中有參數(shù):

為了輔助嵌入函數(shù)的學(xué)習(xí),這篇文章還增加學(xué)習(xí)了一個(gè)推理函數(shù) q_Ψ,其作用為給定一個(gè)狀態(tài)唯一的軌跡窗口,預(yù)測生成潛在向量 z。它在給定一個(gè)僅包含狀態(tài)的軌跡窗口的情況下,預(yù)測生成該軌跡時(shí)輸入到低級技能策略的潛在向量 z。定義一個(gè)增強(qiáng)的獎(jiǎng)賞函數(shù),它鼓勵(lì)策略為不同的潛在向量探索不同的軌跡,學(xué)習(xí)的過程并行學(xué)習(xí)策略、嵌入函數(shù) p_φ和推理函數(shù) q_Ψ。此外,文章還添加了一個(gè)策略熵獎(jiǎng)勵(lì) H(πθ(ai|si, z)),它確保策略不會崩潰為每種技能的單個(gè)解決方案。

策略梯度強(qiáng)化學(xué)習(xí)

本文使用近端策略優(yōu)化(PPO)來訓(xùn)練強(qiáng)化學(xué)習(xí)的策略和嵌入網(wǎng)絡(luò),使用 MuJoCo 物理引擎來實(shí)現(xiàn) Sawyer 機(jī)器人仿真環(huán)境,另外使用多元高斯分布來表示策略、嵌入和推理函數(shù),由多層感知器的輸出參數(shù)化實(shí)現(xiàn)其平均和對角協(xié)方差,最后,利用強(qiáng)化學(xué)習(xí)算法對策略分布和嵌入分布進(jìn)行聯(lián)合優(yōu)化,同時(shí)利用監(jiān)督學(xué)習(xí)和簡單的交叉熵?fù)p失對推理分布進(jìn)行訓(xùn)練。

模型預(yù)測控制(MPC)和物理模擬

在前兩步強(qiáng)化學(xué)習(xí)中,機(jī)器人是在一個(gè)仿真框架中進(jìn)行訓(xùn)練的,因此在適應(yīng)未知任務(wù)時(shí),可以將訓(xùn)練前的仿真作為一種輔助工具。這使得機(jī)器人可以選擇一個(gè)潛在的在線技能,只需要滿足任務(wù)的局部最優(yōu)約束,而不要求在訓(xùn)練期間就存在該任務(wù),這也被成為是一種 zero-shot 任務(wù)執(zhí)行。

這種處理方法與我們上面介紹的「縮小模擬和現(xiàn)實(shí)的差距」以及「對模擬階段的策略訓(xùn)練進(jìn)行隨機(jī)化處理」不同,上述兩種方法盡管對模擬環(huán)境進(jìn)行了大量的仿真處理工作,但都沒有證明能夠提供現(xiàn)實(shí)世界中通用機(jī)器人所需的適應(yīng)能力。本文的方法是機(jī)器人強(qiáng)化遷移學(xué)習(xí)中一種適應(yīng)實(shí)際探索的更高層次的補(bǔ)充方法。

首先,將在策略梯度強(qiáng)化學(xué)習(xí)階段得到的潛在技能向量序列輸入到模型中,每個(gè)潛在的技能都與不同的預(yù)學(xué)習(xí)行為相關(guān)。通過選擇這些預(yù)學(xué)習(xí)行為序列(通過技能嵌入持續(xù)參數(shù)化),能夠有效解決新任務(wù)的適應(yīng)問題。重復(fù)使用模擬階段的預(yù)訓(xùn)練結(jié)果,作為在現(xiàn)實(shí)場景中適應(yīng)未知任務(wù)時(shí)的預(yù)見工具,包括技能嵌入向量概率分布 p_φ、潛在條件低級技能策略 π_θ等。MPC 過程如圖 5 所示:

圖 5. 嵌入函數(shù)和多任務(wù)策略的模型預(yù)測控制

候選潛在向量 Z={z_1,...,z_k} 是根據(jù)概率分布 p_φ得到的。在 T 個(gè)時(shí)間步長的時(shí)間范圍內(nèi),對策略 π_θ進(jìn)行抽樣,以潛在的候選策略為條件,執(zhí)行模擬環(huán)境的操作,得到每個(gè)潛在向量 z_i 的獎(jiǎng)賞 Ri_new。計(jì)算得到最大獎(jiǎng)賞值:

再以此為依據(jù)調(diào)整多任務(wù)策略。重復(fù)這個(gè) MPC 過程來依次選擇和執(zhí)行新的潛在向量,直到任務(wù)完成。

本文通過在 Sawyer 機(jī)器人上完成兩個(gè)排序任務(wù)來評估不同的方法:繪制一個(gè)點(diǎn)序列并沿著一個(gè)序列路徑推一個(gè)盒子。對于每一個(gè)實(shí)驗(yàn),機(jī)器人必須通過在嵌入學(xué)習(xí)過程中學(xué)習(xí)到的排序技能來完成一個(gè)整體任務(wù)。

圖 6. 在現(xiàn)實(shí)機(jī)器人上進(jìn)行矩形繪制實(shí)驗(yàn)的夾具位置圖,在這個(gè)實(shí)驗(yàn)中,未知任務(wù)是畫一個(gè)矩形

圖 7. 在現(xiàn)實(shí)機(jī)器人上進(jìn)行三角形繪制實(shí)驗(yàn)的夾具位置圖,在這個(gè)實(shí)驗(yàn)中,未知任務(wù)是移動夾持器來畫一個(gè)三角形

圖 8. 現(xiàn)實(shí)機(jī)器人實(shí)驗(yàn)中的擋塊位置和夾持器位置圖,(左圖):機(jī)器人將盒子向左推,然后向下推;(右圖):機(jī)器人將盒子向上推,然后向左推

圖 6-8 給出了使用本文提出的方法完成 Sawyer 機(jī)器人畫和推兩個(gè)動作的實(shí)驗(yàn)。其中,Sawyer 機(jī)器人通過實(shí)時(shí)選擇 62 個(gè)潛在向量,在 2 分鐘內(nèi)成功地完成了未知的矩形繪制任務(wù),選擇 53 個(gè)潛在向量,在 2 分鐘內(nèi)完成了未知的三角形繪制任務(wù)。Sawyer 機(jī)器人選擇 3 個(gè)潛在變量,在大約 1 分鐘的時(shí)間內(nèi)完成了未知的左下推任務(wù),選擇 8 個(gè)潛在變量,在大約 1.5 分鐘的時(shí)間內(nèi)完成了未知的上左推任務(wù)。

4、力的轉(zhuǎn)移學(xué)習(xí)和控制

Rae Jeong , Jackie Kay ,et al,「Modelling Generalized Forces with Reinforcement Learning for Sim-to-Real Transfer」,

Avaiable:https://arxiv.org/abs/1910.09471

這篇文章主要研究如何有效地利用少量的現(xiàn)實(shí)世界數(shù)據(jù)來改善仿真效果,從而實(shí)現(xiàn)機(jī)器人的強(qiáng)化遷移學(xué)習(xí)。通過學(xué)習(xí)一個(gè)依賴于狀態(tài)的廣義力模型實(shí)現(xiàn)強(qiáng)化遷移學(xué)習(xí),使用神經(jīng)網(wǎng)絡(luò)作為表達(dá)函數(shù)逼近器來模擬動力系統(tǒng)的約束力。

在前三篇文章中,不管是一致性處理、隨機(jī)化處理還是 zero-shot 的策略學(xué)習(xí),都不使用任何現(xiàn)實(shí)世界的數(shù)據(jù)來改進(jìn)模擬器,并且需要手動調(diào)整物理參數(shù)的選擇和范圍以改進(jìn)模擬的效果。這篇文章的思路是,直接引入現(xiàn)實(shí)世界中機(jī)器人的物理動作(作用力),而不是僅依靠模擬環(huán)境中的參數(shù),從而改進(jìn)模擬器的效果。

首先,介紹一下力學(xué)相關(guān)的背景知識。在經(jīng)典力學(xué)中,任何受外力作用的剛體系統(tǒng)都可以用下列運(yùn)動方程來描述:

其中 q 和 v 分別是系統(tǒng)配置和速度,m 為質(zhì)量矩陣;c 為偏心力,包括科里奧利力、離心力、關(guān)節(jié)摩擦力和重力。τ表示內(nèi)部、驅(qū)動、扭矩,0_m 表示未驅(qū)動變量。6 維的力 f_k 通過對應(yīng)的接觸雅可比 J_k 映射為廣義力。如果系統(tǒng)相互作用或與環(huán)境相互作用,則上式還需要補(bǔ)充描述接觸約束的附加方程。在不假設(shè)接觸類型的情況下,本文將這些約束表示為相關(guān)系統(tǒng)狀態(tài)的一般函數(shù):

仍使用 MDP 描述強(qiáng)化學(xué)習(xí)過程。強(qiáng)化學(xué)習(xí)的目標(biāo)是找到最佳策略π:

引入一個(gè)動作值函數(shù),利用一步 Bellman 方程 Q(s, a) 計(jì)算策略π的期望獎(jiǎng)賞之和:

在策略評估階段通過策略外強(qiáng)化學(xué)習(xí)計(jì)算得到期望獎(jiǎng)賞之和,在策略改進(jìn)階段利用策略評估結(jié)果改進(jìn)策略本身。公式(1)和(2)代表的策略優(yōu)化和期望獎(jiǎng)賞值計(jì)算兩個(gè)步驟迭代執(zhí)行。

針對機(jī)器人強(qiáng)化遷移學(xué)習(xí)問題,除了驅(qū)動力和外力外,在運(yùn)動方程中添加了一個(gè)與狀態(tài)相關(guān)的廣義力項(xiàng):

由此,得到一個(gè)以矢量θ為參數(shù)的混合離散動力學(xué)模型 s_t+1=f_θ(s_t , a_t),以當(dāng)前狀態(tài)和作用為輸入、下一狀態(tài) s_{t+1} 的預(yù)測為輸出。目標(biāo)是找到參數(shù)向量θ*,它使沿水平面 t 的動力學(xué)間隙最小化:

此時(shí),強(qiáng)化學(xué)習(xí)的目標(biāo)函數(shù)為:

其中,P_S 為未修正力學(xué)動態(tài)模型的轉(zhuǎn)移概率分布。將得到的廣義力模型(Generalized Force Model,GFM)F_φ用作過渡模型 P_f,然后,使用帶有轉(zhuǎn)移概率分布 P_f 的混合模型為感興趣的控制任務(wù)訓(xùn)練策略,得到以下強(qiáng)化學(xué)習(xí)目標(biāo):

圖 9. 所提出方法步驟的描述

圖 9 給出所提出方法步驟的完整描述。1)使用原始模型參數(shù)對 agent 進(jìn)行模擬訓(xùn)練。2)使用步驟 1 中訓(xùn)練得到的 agent 收集現(xiàn)實(shí)世界的數(shù)據(jù)。3)學(xué)習(xí)廣義力模型(GFM):將仿真初始化為現(xiàn)實(shí)世界軌跡的初始狀態(tài),選擇與現(xiàn)實(shí)機(jī)器人相同的動作推進(jìn)模擬過程。

本文將所提出的方法與三種基線方法進(jìn)行了比較,分別是:i)用原始動態(tài)模型訓(xùn)練的策略,ii)用原始模型訓(xùn)練的策略和使用課程學(xué)習(xí)的策略,以及 iii)用廣義力隨機(jī)擾動訓(xùn)練的策略和使用課程學(xué)習(xí)的策略。表 1 和表 2 分別為位置和姿態(tài)匹配的結(jié)果。本文的方法獲得了與基線方法相比顯著的改進(jìn),這也證明了引入現(xiàn)實(shí)場景中的力學(xué)參數(shù)對于改進(jìn)強(qiáng)化遷移學(xué)習(xí)的效果有正向的作用。

表 1. 位置匹配任務(wù)評估

表 2. 姿勢匹配任務(wù)評估

這篇文章引入了狀態(tài)相關(guān)廣義力(Generalized Forces)建模和學(xué)習(xí),以捕獲模擬環(huán)境與現(xiàn)實(shí)環(huán)境間的差異。從力學(xué)角度分析,在控制相互作用力時(shí),通常選擇扭矩控制作為底層控制器,但是這篇文章認(rèn)為在強(qiáng)化學(xué)習(xí)中使用扭矩控制并不常見,因此采用了「在運(yùn)動方程中添加了一個(gè)與狀態(tài)相關(guān)的廣義力項(xiàng)(GFM)」的處理方式。未來的工作可以進(jìn)一步探討,使用本文提出的廣義力模型是否有助于學(xué)習(xí)交互任務(wù),同時(shí)也可以引入扭矩控制來控制機(jī)器人。

5、其它任務(wù)學(xué)習(xí)方法

Oier Mees , Markus Merklinger , et. al.,「Adversarial Skill Networks- Unsupervised Robot Skill Learning from Video,」

Available:https://arxiv.org/abs/1910.09430

這篇文章提出了一種對抗技能網(wǎng)絡(luò)(Adversarial Skill Networks,ASN),它僅依賴于未標(biāo)記的多視圖觀察(視頻輸入)來學(xué)習(xí)任務(wù)不可知的技能嵌入空間,而不需要任何額外的監(jiān)督信息,就能找到一個(gè)適用于不同任務(wù)域的嵌入空間。ASN 是作為 Sim-to-Real 方法的前置步驟提出的,它不僅適用于機(jī)器人的強(qiáng)化遷移學(xué)習(xí),也適用于其它發(fā)現(xiàn)并學(xué)習(xí)可轉(zhuǎn)移的技能任務(wù)。在這篇文章中,只進(jìn)行了模擬環(huán)境中的實(shí)驗(yàn)驗(yàn)證,這與前四篇文章的分析是不同的。下一步,可以進(jìn)一步研究擴(kuò)展將 ASN 學(xué)習(xí)到的度量應(yīng)用于現(xiàn)實(shí)世界中的強(qiáng)化學(xué)習(xí)任務(wù)中。

ASN 的主要目的是生成可以重復(fù)使用并適用于新任務(wù)的技能表現(xiàn)(Skill Representation),對應(yīng)的嵌入空間具有如下特點(diǎn):

  • 通用性:多個(gè)任務(wù)可以在同一個(gè)嵌入空間中表示;
  • 獨(dú)立于任務(wù)的技能:所提取的嵌入空間能夠保證在不同環(huán)境中執(zhí)行相同任務(wù)都具有良好的性能。

ASN 整體結(jié)構(gòu)如圖 10 所示。在對抗性框架中學(xué)習(xí)技能度量空間,其中編碼部分使用最大化熵來保證通用性,鑒別器部分則使用最小化預(yù)測熵來提高對技能的識別能力。最后,最大化所有技能的邊際類熵從而有效提取獨(dú)立于任務(wù)的技能特征。

圖 10. 對抗技能網(wǎng)絡(luò)結(jié)構(gòu)

首先,引入一種新的熵正則化方法,對抗性地聯(lián)合訓(xùn)練兩個(gè)網(wǎng)絡(luò):編碼器 E 和鑒別器 D。給定輸入視頻中的時(shí)間間隔為?t 的兩個(gè)連續(xù)幀(v,w),定義一個(gè)未標(biāo)記的技能嵌入向量 x=(E(v) , E(w)) 和 X={x^1,…,x^N}。編碼器 E 將 d1×d2 的單個(gè)幀嵌入到 n 維的低維表示中,計(jì)算嵌入空間中的歐氏距離來比較幀的相似性。鑒別器 D 采用兩個(gè)串聯(lián)的嵌入式幀,定義一個(gè)未標(biāo)記的技能 x 作為輸入,輸出為 y_c。

使用度量學(xué)習(xí)損失和最大化鑒別輸出的熵來更新編碼器參數(shù)。給定兩個(gè)視圖對(v1,v2),給定邊際參數(shù)λ,從不同角度同步視頻:

其中,S_ij= E(X_i) · E(X_j)。在給定一個(gè)未標(biāo)記的技能嵌入 x 的情況下,鑒別器網(wǎng)絡(luò) D 將熵最小化,以確定該技能來自哪個(gè)任務(wù) C,值得注意的是,D 僅在訓(xùn)練階段使用。這篇文章對鑒別器的處理是根據(jù)預(yù)測類別分布的信息論測度,在技能嵌入空間中將未標(biāo)記的技能劃分為多個(gè)類別,而不需要對 p(x) 進(jìn)行顯式建模。編碼器試圖最大化熵 H[p(y_c | x,D)],在最佳情況下,能夠保證任務(wù)類的均勻條件分布。具體地說,將嵌入技能樣本 X 上的條件熵的經(jīng)驗(yàn)估計(jì)定義為:

引入一個(gè)附加的正則化算子進(jìn)一步增強(qiáng)所有任務(wù)類的等價(jià)使用,對應(yīng)于最大化均勻的邊緣分布:

為了分離學(xué)習(xí)到的度量和任務(wù) ID 的映射,添加一個(gè)采樣的潛在變量 z。使用重參數(shù)化技巧通過隨機(jī)節(jié)點(diǎn)反向傳播利用潛在變量 z 的 Kullback-Leibler 散度正則化,使得 D 能夠有效表征技能的相似性質(zhì)。最終,E 和 D 的目標(biāo)函數(shù)為:

圖 11 給出了 ASN 應(yīng)用于機(jī)器人學(xué)習(xí)的實(shí)驗(yàn)結(jié)果,其中使用時(shí)間對比網(wǎng)絡(luò)(Time-Contrastive Networks,TCN)作為對比基線算法。將使用 ASN 學(xué)習(xí)到的度量集成到機(jī)器人強(qiáng)化學(xué)習(xí)的 agent 中,以模擬給定單個(gè)視頻演示的不可見任務(wù)。具體說明,為了學(xué)習(xí)顏色疊加(C)任務(wù)的連續(xù)控制策略,訓(xùn)練了兩塊疊加(A)和顏色推送(B)任務(wù)的嵌入。在給定關(guān)于疊加和顏色疊加任務(wù)的嵌入訓(xùn)練結(jié)果的前提下,學(xué)習(xí)預(yù)先未知的顏色推送任務(wù)的連續(xù)控制策略。該實(shí)驗(yàn)中使用策略優(yōu)化算法 PPO 訓(xùn)練 agent。實(shí)驗(yàn)結(jié)果證明了在該場景下 ASN 的有效性,ASN 能夠?qū)W(xué)習(xí)到的技能用于新任務(wù),且獲得了較好的性能。

圖 11. 使用學(xué)習(xí)的獎(jiǎng)賞函數(shù)訓(xùn)練 PPO 對不可見的顏色推送和顏色疊加任務(wù)的連續(xù)控制策略的結(jié)果。圖中顯示了五次訓(xùn)練的平均值和標(biāo)準(zhǔn)差。

文章小結(jié)

在本文中,我們針對機(jī)器人的強(qiáng)化遷移學(xué)習(xí)問題分析和梳理了近年來的重要研究方向和進(jìn)展。機(jī)器人的強(qiáng)化遷移學(xué)習(xí)的核心在于基于模擬環(huán)境中豐富的樣本數(shù)據(jù)來訓(xùn)練機(jī)器人控制策略,通過引入遷移學(xué)習(xí)的方法,將控制策略轉(zhuǎn)移于現(xiàn)實(shí)中的物理機(jī)器人。因此,研究和改進(jìn)主要集中于提升策略遷移應(yīng)用于機(jī)器人的效果。通過本文的分析我們可以看到,研究人員重點(diǎn)考慮的是改進(jìn)策略本身、縮小模擬環(huán)境與物理環(huán)境之間差異等手段,一方面努力提升模擬環(huán)境中狀態(tài)和動作的普適性,另一方面嘗試將物理環(huán)境中的一些參數(shù)引入到模擬環(huán)境策略訓(xùn)練中。其中,第一篇文章使用從現(xiàn)實(shí)機(jī)器人中收集的數(shù)據(jù)訓(xùn)練 LSTM 來預(yù)測模擬和現(xiàn)實(shí)世界之間的差距,而第二篇文章是對狀態(tài)和動作進(jìn)行隨機(jī)化處理,從而得到動態(tài)的、高適應(yīng)性的策略,其中也使用了 LSTM,在這里 LSTM 的作用是計(jì)算推斷動態(tài)參數(shù)所需的信息。第三篇文章是在模擬階段利用變分方法直接求得足夠好的策略,實(shí)現(xiàn)了在現(xiàn)實(shí)機(jī)器人中不經(jīng)微調(diào)處理即可成功的完成未知任務(wù),從而使得遷移過程更加健壯。第四篇文章直接引入現(xiàn)實(shí)世界中機(jī)器人的物理動作,而不再是僅依靠模擬環(huán)境中的參數(shù),從而改進(jìn)模擬器的效果。第五篇文章提出了一種對抗技能網(wǎng)絡(luò)來找到適用于不同任務(wù)域的嵌入空間,該方法不僅適用于機(jī)器人的強(qiáng)化遷移學(xué)習(xí),也適用于其它發(fā)現(xiàn)并學(xué)習(xí)可轉(zhuǎn)移的技能任務(wù)。

本文提到的參考文獻(xiàn):

[1]J. Schulman, F. Wolski, P . Dhariwal, A. Radford, and O. Klimov. Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347, 2017.

[2] W. Yu, C. K. Liu, and G. Turk,「Preparing for the unknown: Learning a universal policy with online system identification,」CoRR, vol. abs/1702.02453, 2017. [Online]. Available: arxiv.org/abs/1702.02453

[3] M. Andrychowicz, F. Wolski, A. Ray, J. Schneider, R. Fong, P . Welinder, B. McGrew, J. Tobin, P . Abbeel, and W. Zaremba,「Hindsight experience replay,」in Advances in Neural Information Processing Systems, 2017.

本 文為機(jī)器之心原創(chuàng), 轉(zhuǎn)載請聯(lián)系本公眾號獲得授權(quán) 。

投稿或?qū)で髨?bào)道: content @jiqizhixin

廣告 & 商務(wù)合作:bd@jiqizhixinF

 
 
免責(zé)聲明
本文為會員免費(fèi)發(fā)布,僅代表發(fā)布者個(gè)人觀點(diǎn),本站未對其內(nèi)容進(jìn)行核實(shí),請讀者僅做參考,如若文中涉及有違公德、觸犯法律的內(nèi)容,一經(jīng)發(fā)現(xiàn),立即刪除,作者需自行承擔(dān)相應(yīng)責(zé)任。涉及到版權(quán)或其他問題,請及時(shí)聯(lián)系我們刪除處理。
 
 
主站蜘蛛池模板: 99视频免费观看蜜桃视频| 国产精品久久久久久久av大片| 丰满少妇久久久| 国产日韩av在线播放| 欧美久久在线观看| www黄色av| 91国产精品视频在线| 日韩一区视频在线| 欧美激情国产精品| 久久天天躁狠狠躁夜夜躁| 欧美精品久久久| 国产精品91视频| 国产精品久久国产三级国电话系列| 国产精品久久久久不卡| 高清视频一区二区三区| 91精品国产一区| 日本一区二区三区精品视频| 久久99久久99精品| 蜜桃av久久久亚洲精品| 国产欧美日韩高清| 大波视频国产精品久久| 日韩欧美亚洲日产国| 国产精品久久久久久久久久久久| 不卡视频一区二区三区| 啊v视频在线一区二区三区| 国产精品91视频| 久久久久国色av免费观看性色| 久久在线免费观看视频| 国产精品九九久久久久久久| 午夜精品美女自拍福到在线| 日韩一区视频在线| 国产精品视频久| 亚洲伊人成综合成人网| 欧美精品在线免费| 国产精品10p综合二区| 日韩福利视频| 日韩一区在线视频| 国产麻豆日韩| 久久精品视频va| 日韩精品资源| 欧美日韩国产成人|