大數(shù)據(jù)文摘出品 來源:venturebeat編譯:張秋玥
世界最大AI與機器學習會議之一的NeurlPS于本月初舉行,NeurIPS 2017和NeurIPS 2018分別收到了3240和4854份研究論文,但今年的活動(于12月8日至12月14日在加拿大溫哥華舉行)輕松地打破了這一記錄——總共收到了約6600份論文。
相比于其他AI和機器學習會議,今年的NeurlPS中最活躍的類別是機器人技術,英特爾、加州大學伯克利分校和許多機器人領域的專家參加了研討會和論文演講。其中最吸引人的研究當屬訓練機器人共同解決某一問題的新穎方法,以及通過人類視頻的像素級翻譯來訓練機器人完成多階段任務學習。
多階段任務學習
伯克利大學電氣工程和計算機科學系的研究人員設計了一個旨在減輕定義任務和重置環(huán)境方面人員負擔的系統(tǒng)。他們的AVID框架通過CycleGAN將每個步驟的人工指令轉換成機器人指令,該技術涉及使用來自兩個無需關聯(lián)的領域的圖像集合來訓練圖像到圖像的翻譯模型。
在實踐中,機器人一次將一項任務內部化,自動發(fā)現(xiàn)如何重置階段以重試任務,無需人工干預。這使得從直觀的視頻任務說明再到學習過程在很大程度上是自動化的。
研究人員說,在實驗中AVID已成功地學習了一些任務,例如操作咖啡機和直接從原始圖像實例中取回杯子。只需要20分鐘的訓練,模型即可提供人類演示,而再來約180分鐘的訓練,機器人就能夠進行與環(huán)境的互動。在一項任務中,使用真實機器人演示而非人類演示視頻的行為進行的克隆表現(xiàn)更好。
為分攤進行特定任務訓練CycleGAN模型的成本,他們安排了許多未來的研究方向,比如通過重用訓練有素的CycleGAN模型來轉換其他某些相關任務的演示。研究人員認為,我們可以將訓練過程寬泛化,使用包含環(huán)境中多種不同的人類和機器人行為的大型數(shù)據(jù)集,從而使得模型只需幾次人類演示就能學習新任務。
訓練機器人進行團隊合作
英特爾的研究人員試圖通過名為CERL的框架(即Collaborative Evolutionry Reinforcement Learning,協(xié)作式進化強化學習)來解決機器學習中的兩個長期問題,即對環(huán)境探索的不積極和對超參數(shù)的選擇高度敏感(或在學習過程開始之前已設值的參數(shù))的問題。它是一組優(yōu)化算法的集合,這些算法共同提高了采樣效率,并動態(tài)分配計算資源以支持表現(xiàn)最好的那些模型。
CERL中的學習目標分為兩個同時運行的優(yōu)化過程。系統(tǒng)構建模型“團隊”整體,并評估每個團隊在實際任務上的績效。經(jīng)過這些評估,表現(xiàn)最好的團隊將會留在一起,而那些突變步驟則會將表現(xiàn)差強人意的團隊分解并改造為新團隊。
重要的是,每個模型都有一個共享的“重放緩沖區(qū)”。這實際上就是一個數(shù)據(jù)庫,可以邊進行探索邊存儲學習到的經(jīng)驗。CERL構建的共享緩沖區(qū)與團隊位置一樣多,因此團隊成員可以從所有團隊所有版本的經(jīng)驗中學習。正是這種分層次的方法使CERL能夠在許多困難的基準上達到最先進的性能,包括從頭開始訓練3D人形模型行走。
將來,該團隊計劃研究在沒有明確的獎勵反饋的情況下涉及多任務學習的類似問題。他們還希望探討溝通機制在解決此類任務中的作用。他們指出這其實是構筑于簡單認知之上的一大類問題。
意外驚喜:冰壺機器人
正如研究人員所指出的那樣,冰壺冰原傳統(tǒng)上覆蓋著卵石,卵石的狀況會隨著時間而變化,具體取決于溫度、濕度、制冰機、維護結束后經(jīng)過的時間以及比賽期間的清掃量。因此,冰壺的運動軌跡會隨著時間變化。
Curly通過部署基于物理的仿真器來解決此問題。該仿真器旨在調整包括投擲角度、速度和方向的參數(shù),直到找到最佳策略為止。機器人的投擲器組件在冰蓋上執(zhí)行此策略,同時握住并旋轉冰壺石,隨后展開抓臂,釋放冰壺石。Skip組件在跟蹤預測冰壺石的位置與路線同時考慮潛在的變化。
根據(jù)研究人員的說法,Curly在冰上實驗中表現(xiàn)非常出色。具體來說這些試驗包括經(jīng)典游戲環(huán)境,以及在與韓國頂級業(yè)余高中團隊等人類對手的互動場景。在未來的研究中,他們將使用可解釋的AI技術以更好地了解關鍵性擊球的影響,從而使機器人從錯誤中更好地學習。
相關報道:
https://venturebeat/2019/12/18/neurips-2019-featured-robotic-curling-players-and-coffee-makers/


