亚洲国产成人精品久久_欧美日韩国产综合一区二区_亚洲精品理论电影_色综合久久中文字幕

首頁 » 早鳥快報 » 化工 » 正文

強化學習常用算法+實際應用,必須get這些核心要點!

放大字體  縮小字體 發布日期:2020-01-06  來源:來自互聯網  作者:來自互聯網  瀏覽次數:953
導讀

強化學習是一種機器學習技術,它使代理能夠使用自身行為和經驗的反饋通過反復試驗在交互式環境中學習。無監督學習的目標是發現數據點之間的相似點和差異,而在強化學習的情況下,目標是找到合適的行為模型,以最大化智…

編輯:元子

【新智元導讀】強化學習(RL)是現代人工智能領域中最熱門的研究主題之一,其普及度還在不斷增長。本文介紹了開始學習RL需要了解的核心要素。戳右邊鏈接上新智元小程序 了解更多!

強化學習是現代人工智能領域中最熱門的研究主題之一,其普及度還在不斷增長。

強化學習是什么?和其他機器學習技術有何區別?

強化學習是一種機器學習技術,它使代理能夠使用自身行為和經驗的反饋通過反復試驗在交互式環境中學習。

盡管監督學習和強化學習都使用輸入和輸出之間的映射,但監督學習提供給智能體的反饋是執行任務的正確動作集,而強化學習則將獎懲作為正面和負面行為的信號。

無監督學習在目標方面有所不同。無監督學習的目標是發現數據點之間的相似點和差異,而在強化學習的情況下,目標是找到合適的行為模型,以最大化智能體的總累積獎勵。

下圖說明了通用強化學習模型的動作獎勵反饋回路。

如何制定基本的強化學習問題?

一些描述強化學習問題基本要素的關鍵術語是:

  • 環境-智能體在其中運行的物理狀態
  • 狀態-智能體的當前狀況
  • 獎勵-來自環境的反饋
  • 策略-映射智能體狀態到動作的方法
  • 值-智能體在特定狀態下采取的行動將獲得的未來獎勵

強化學習問題可以通過游戲來最好地解釋。讓我們以吃豆人游戲為例,智能體(PacMan)的目標是在網格中吃掉食物,同時避開途中出現的鬼魂。

在這種情況下,網格世界是智能體所作用的交互式環境。智能體成功遲到豆豆會得到獎勵,如果智能體被幽靈殺死(輸掉了游戲)則會被懲罰。

狀態值得是智能體在網格世界中的位置,總累積獎勵是贏得比賽。

為了建立最優政策,智能體面臨探索新狀態的困境,同時又要使其整體收益最大化,這稱為“探索與開發”的權衡。

為了平衡兩者,最佳的整體策略可能涉及短期犧牲。因此,智能體應該收集足夠的信息,以便將來做出最佳的總體決策。

馬爾可夫決策過程(MDP)是描述強化學習環境的數學框架,幾乎所有強化學習問題都可以使用MDP來表述。

一個MDP由一組有限的環境狀態S,在每種狀態下的一組可能的動作A,一個實值獎勵函數R和一個過渡模型P(s’,s | a)組成。

但是,現實環境更可能缺少任何有關環境動力學的先驗知識。在這種情況下,無模型強化學習方法非常有用。

Q學習是一種常用的無模型方法,可用于構建自己玩的PacMan智能體。它圍繞更新Q值的概念展開,Q值表示在狀態s中執行動作a的值。以下值更新規則是Q學習算法的核心。

什么是最常用的強化學習算法?

Q學習和SARSA(狀態-行動-獎勵-狀態-行動)是兩種常用的無模型強化學習算法。它們的勘探策略不同,而利用策略卻相似。

Q-學習是強化學習的一種方法。Q-學習就是要記錄下學習過的政策,因而告訴智能體什么情況下采取什么行動會有最大的獎勵值。Q-學習不需要對環境進行建模,即使是對帶有隨機因素的轉移函數或者獎勵函數也不需要進行特別的改動就可以進行。

對于任何有限的馬可夫決策過程(FMDP),Q-學習可以找到一個可以最大化所有步驟的獎勵期望的策略,在給定一個部分隨機的策略和無限的探索時間,Q-學習可以給出一個最佳的動作選擇策略。“Q”這個字母在強化學習中表示一個動作的品質(quality)。

而SARSA是一種策略上方法,在其中根據其當前操作a得出的值來學習值。這兩種方法易于實現,但缺乏通用性,因為它們無法估計未知狀態的值,這可以通過更高級的算法來克服,例如使用神經網絡來估計Q值的Deep Q-Networks(DQNs)。但是DQN只能處理離散的低維操作空間。

深度確定性策略梯度(DDPG)是一種無模型,脫離策略,actor-critic的算法,它通過在高維連續操作空間中學習策略來解決此問題。下圖是actor-critic體系結構的表示。

強化學習的實際應用是什么?

由于強化學習需要大量數據,因此它最適用于容易獲得模擬數據的領域,例如游戲性,機器人技術。

強化學習被廣泛用于構建用于玩計算機游戲的AI。AlphaGo Zero是第一個在古代中國的圍棋游戲中擊敗世界冠軍的計算機程序。其他包括ATARI游戲,西洋雙陸棋等。在機器人技術和工業自動化中,強化學習用于使機器人自己創建有效的自適應控制系統,該系統從自身的經驗和行為中學習。DeepMind在“通過異步策略更新進行機器人操縱的深度強化學習”方面的工作就是一個很好的例子。

強化學習的其他應用包括抽象文本摘要引擎,可以從用戶交互中學習并隨時間改進的對話智能體(文本,語音),學習醫療保健中的最佳治療策略以及用于在線股票交易的基于強化學習的智能體。

 
 
免責聲明
本文為會員免費發布,僅代表發布者個人觀點,本站未對其內容進行核實,請讀者僅做參考,如若文中涉及有違公德、觸犯法律的內容,一經發現,立即刪除,作者需自行承擔相應責任。涉及到版權或其他問題,請及時聯系我們刪除處理。
 
 
主站蜘蛛池模板: 91国产在线播放| 欧美中日韩免费视频| 日韩一区二区在线视频| 久久亚洲综合网| 国产精品国内视频| www欧美日韩| 日本视频一区二区不卡| 国产精品高潮呻吟久久av野狼| 久久99久久99精品中文字幕| 日本亚洲精品在线观看| 欧美日韩精品中文字幕一区二区| 在线国产99| 日本国产高清不卡| 激情小说综合区| 国产在线精品自拍| 久久精品亚洲国产| 欧美精品色婷婷五月综合| 欧美精品一区二区性色a v| 国产欧美日韩综合精品| 午夜精品在线视频| 国产精品美女免费视频| 韩日欧美一区二区| 久久精品国产欧美亚洲人人爽| 日韩中文字幕一区二区| 久久99精品久久久久久噜噜| 精品无人区一区二区三区| 欧美 日韩 国产在线| 国产欧美日本在线| 国产精品一区二区免费看| 精品国产一区二区三区久久狼黑人 | av不卡在线免费观看| 精品国偷自产在线| 亚州国产精品久久久| 午夜精品久久久久久久99热| 五月天在线免费视频| 国产精品久久在线观看| 久久的精品视频| 国产免费成人av| 色婷婷成人综合| 精品久久久久久无码中文野结衣 | 国产欧美日韩中文|