• <track id="oztn4"></track>
    <sup id="oztn4"><form id="oztn4"></form></sup>
    
    
    <mark id="oztn4"></mark>
  • <dfn id="oztn4"><samp id="oztn4"></samp></dfn>
      《地爆天星小姐》电影 ,麦子交换2免费观看2023年上映时间表 ,莫妮卡《爱我几何》,大牛影库战狼6欧式少女全部视频,三年大片国语版在线看,日本空姐电视剧,电影魔镜号中文字幕,和部长一起去出差旅是第几集
      全球「AI學(xué)術(shù)頂會(huì)」精華匯聚地
      您正在使用IE低版瀏覽器,為了您的雷峰網(wǎng)賬號(hào)安全和更好的產(chǎn)品體驗(yàn),強(qiáng)烈建議使用更快更安全的瀏覽器
      此為臨時(shí)鏈接,僅用于文章預(yù)覽,將在時(shí)失效
      國(guó)際 正文
      發(fā)私信給AI科技評(píng)論
      發(fā)送

      1

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      導(dǎo)語(yǔ):國(guó)際機(jī)器學(xué)習(xí)大會(huì)上,谷歌DeepMind的主程序員發(fā)布論文,探討AI如何解決不完美信息游戲。

      6月19日(美國(guó)時(shí)間)在紐約舉行的國(guó)際機(jī)器學(xué)習(xí)大會(huì)(ICML)上,來(lái)自谷歌、Facebook以及頂尖研究學(xué)府的科學(xué)家們通過(guò)論文和講座,分享了最尖端的機(jī)器學(xué)習(xí)研究成果。其中,谷歌DeepMind科學(xué)家David Silver在講座“深度增強(qiáng)學(xué)習(xí)”中分享了深度神經(jīng)網(wǎng)絡(luò)在各項(xiàng)實(shí)際應(yīng)用中的算法。雖然David Silver不如DeepMind CEO Demis Hassabis那么為人所知,實(shí)際上,他正是DeepMind圍棋團(tuán)隊(duì)一直雪藏的主程序員。 ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      從左到右:David Silver、Demis Hassabis和圍棋冠軍李世石。圖片來(lái)源:BI

      David Silver以班級(jí)最優(yōu)成績(jī)從劍橋大學(xué)畢業(yè),正是在劍橋他與Demis Hassabis相識(shí),據(jù)稱也正是Hassabis教會(huì)了Silver如何下圍棋。畢業(yè)后,Silver成立了游戲公司 Elixir 并擔(dān)任CTO及程序負(fù)責(zé)人,贏得了一系列科技創(chuàng)新獎(jiǎng)項(xiàng)。2004年Silver開(kāi)始攻讀PHD,期間聯(lián)合引入了初代圍棋程序的算法,該算法當(dāng)時(shí)在9 x 9的棋盤(pán)打贏人類。Silver從DeepMind創(chuàng)立之初便一直擔(dān)任顧問(wèn),2013年全職加入團(tuán)隊(duì),2014年谷歌收購(gòu)了DeepMind。今年3月,DeepMind的人工智能算法AlphaGo在19 x 19的標(biāo)準(zhǔn)棋盤(pán)上打贏了人類圍棋冠軍。Hassabis對(duì)英國(guó)《衛(wèi)報(bào)》說(shuō):“我們?cè)?jīng)幻想著今生可以做這樣的事情(創(chuàng)造強(qiáng)大的AI),所以,我們19歲的自己如果知道了,應(yīng)該會(huì)感到安心。”

      Silver此次ICML的講座主要探討應(yīng)用廣泛的增強(qiáng)學(xué)習(xí)技術(shù)。“人工智能的一個(gè)主要目標(biāo),是創(chuàng)造具有通用目標(biāo)的代理,能夠在眾多具有挑戰(zhàn)性的任務(wù)中高效運(yùn)行。為實(shí)現(xiàn)這一目標(biāo),我們需要將增強(qiáng)學(xué)習(xí)(RL)代理與強(qiáng)大、靈活的表征結(jié)合起來(lái)。RL的關(guān)鍵概念是利用神經(jīng)網(wǎng)絡(luò)來(lái)獲得這種表征的力量。這場(chǎng)講座中,我們將介紹一系列深度神經(jīng)網(wǎng)絡(luò)用于估值函數(shù)、策略或者環(huán)境模型的算法。我們將呈現(xiàn)各個(gè)領(lǐng)域內(nèi)最頂尖的研究結(jié)果,包括Atari游戲、3D導(dǎo)航任務(wù)、持續(xù)控制以及圍棋。”

      講座中提到,DeepMind的強(qiáng)化學(xué)習(xí)的不只應(yīng)用于Atari游戲、撲克和圍棋,還包括導(dǎo)航領(lǐng)域中的3D世界和迷宮,控制物理系統(tǒng)中如何進(jìn)行操作、走路和游泳等動(dòng)作,還有在用戶交互層面的推薦、優(yōu)化和個(gè)人化等等。

      今年8月,Demis Hassabis等人工智能技術(shù)先驅(qū)們將來(lái)到雷鋒網(wǎng)“人工智能與機(jī)器人創(chuàng)新大會(huì)”。在此,我們?yōu)榇蠹曳窒鞤avid Silver的論文《不完美信息游戲中的深度強(qiáng)化學(xué)習(xí)自我對(duì)戰(zhàn)》。本篇論文主要以撲克進(jìn)行實(shí)驗(yàn),探討深度強(qiáng)化學(xué)習(xí)與普通強(qiáng)化學(xué)習(xí)相比的優(yōu)勢(shì)。研究此類游戲不只是可以讓程序打贏人類大師,還可以幫助開(kāi)發(fā)算法,應(yīng)用于更復(fù)雜的真實(shí)世界環(huán)境中,例如機(jī)場(chǎng)和網(wǎng)絡(luò)安全、金融和能源貿(mào)易、交通管制和疏導(dǎo),幫助人們?cè)诓煌昝赖男畔⒑透呔S度信息狀態(tài)空間中進(jìn)行決策。深度強(qiáng)化學(xué)習(xí)不需要依賴人類專家的原有知識(shí),這解決了游戲的可擴(kuò)展性問(wèn)題,未來(lái)算法可以不依賴成本高昂的人類專家,也不用擔(dān)心受到偏見(jiàn)等非理性因素的影響,就能幫助決策。論文的另一位作者是倫敦大學(xué)學(xué)院的研究學(xué)生 Johannes Heinrich。

      論文摘要

      許多真實(shí)世界應(yīng)用可以描述為不完美信息游戲的擴(kuò)展版本。對(duì)于這些挑戰(zhàn)巨大的領(lǐng)域,之前的研究主要集中在計(jì)算手工抽象出來(lái)的納什均衡。這篇論文中,我們引入第一個(gè)可擴(kuò)展的端到端方法,無(wú)需預(yù)先具備任何知識(shí),就能學(xué)會(huì)模擬納什均衡。我們的方法將虛擬自我對(duì)戰(zhàn)與深度強(qiáng)化學(xué)習(xí)結(jié)合起來(lái)。當(dāng)應(yīng)用在德州撲克時(shí),神經(jīng)虛擬自我對(duì)戰(zhàn)(NFSP)達(dá)到了一種納什均衡,而普通的強(qiáng)化學(xué)習(xí)方法則出現(xiàn)了偏離。在限制德州拿住撲克中(一種真實(shí)世界規(guī)模的撲克游戲),NFSP學(xué)會(huì)了一種很有競(jìng)爭(zhēng)力的策略,實(shí)現(xiàn)了人類專家的能力和頂尖的方法

      1、簡(jiǎn)介

      歷史上,游戲一直推動(dòng)著人工智能和機(jī)器學(xué)習(xí)的進(jìn)步(Samuel, 1959; Tesauro, 1995; Campbell 等人, 2002; Riedmiller 等人, 2009; Gelly 等人, 2012; Bowling 等人, 2015)。游戲理論將游戲定義為一個(gè)沖突區(qū)域或者多方的合作(Myerson,1991)。之所以學(xué)習(xí)比較簡(jiǎn)單的娛樂(lè)游戲,其中一個(gè)目的是開(kāi)發(fā)算法,可以擴(kuò)展到更加復(fù)雜的真實(shí)世界游戲,例如機(jī)場(chǎng)和網(wǎng)絡(luò)安全、金融和能源貿(mào)易、交通管制和疏導(dǎo)(Lambert III 等人, 2005; Nevmyvaka 等人, 2006; Bazzan, 2009; Tambe, 2011; Urieli & Stone, 2014; Durkota 等人, 2015)。大部分這些真實(shí)世界游戲都需要進(jìn)行決策,而決策基于不完美的信息以及高維度的信息狀態(tài)空間。不幸的是,許多已經(jīng)應(yīng)用到經(jīng)典游戲中的機(jī)器學(xué)習(xí)方法,在信息不完美的游戲中缺少收斂的保證。另一方面,許多游戲理論方法缺少抽取相關(guān)模式、并從數(shù)據(jù)中概況的能力。這讓大型游戲的可擴(kuò)展性有限,除非使用人類專家知識(shí)、啟發(fā)式方法和建模來(lái)將該領(lǐng)域抽象化至可控的規(guī)模。然而,獲取人類專業(yè)知識(shí)競(jìng)猜需要昂貴的資源和時(shí)間。此外,人類很容易出現(xiàn)非理性的決策或者假設(shè)(Selten, 1990;Ariely & Jones,2008)。這讓我們希望開(kāi)發(fā)算法,端到端地學(xué)習(xí)有用的策略。

      這篇論文中我們引入NFSP,一個(gè)深度強(qiáng)化學(xué)習(xí)方法,可以學(xué)習(xí)模擬不完美信息游戲的納什均衡。NFSP 代理的學(xué)習(xí)方法是與自己對(duì)戰(zhàn),無(wú)需預(yù)先具有明確的知識(shí)。技術(shù)上來(lái)說(shuō),NFSP 利用神經(jīng)網(wǎng)絡(luò)函數(shù)模擬,將虛擬自我對(duì)戰(zhàn)(FSP)(Heinrich 等人, 2015)擴(kuò)展并實(shí)例化。一個(gè) NFSP 代理由兩個(gè)神經(jīng)網(wǎng)絡(luò)和兩種記憶組成。強(qiáng)化學(xué)習(xí)利用與代理同伴一起玩的記憶體驗(yàn)來(lái)訓(xùn)練神經(jīng)網(wǎng)絡(luò),預(yù)測(cè)行為的預(yù)期價(jià)值。代理自己行為的經(jīng)驗(yàn)(st,at)儲(chǔ)存在一個(gè)分開(kāi)的記憶中,一個(gè)監(jiān)督學(xué)習(xí)方法利用該記憶來(lái)訓(xùn)練神經(jīng)網(wǎng)絡(luò),預(yù)測(cè)代理自己的平均行為。NFSP 代理可以通過(guò)從自己的行為的平均、常規(guī)策略和貪婪策略(貪婪策略將預(yù)測(cè)的估值最大化)中取樣,從而小心行事。NFSP 模擬虛擬對(duì)戰(zhàn),這是在游戲?qū)W習(xí)中一種流行的游戲理論模型,在一些經(jīng)典游戲中收斂至納什均衡,例如雙玩家零和游戲和多玩家潛在博弈。

      我們?cè)谝粋€(gè)雙人零和計(jì)算機(jī)撲克游戲中實(shí)證評(píng)估了我們的方法。在這個(gè)領(lǐng)域中,目前的游戲理論方法使用啟發(fā)性方法,將游戲抽象至一個(gè)可以駕馭的規(guī)模(Zinkevich 等人, 2007; Gilpin 等人, 2007; Johanson 等人,2013)。雖然限制德州拿住撲克(LHE)——一種真實(shí)世界規(guī)模的撲克游戲——已經(jīng)可以用目前的計(jì)算資源解決(Bowling 等人,2015),大部分其他撲克和真實(shí)世界游戲如果不經(jīng)過(guò)抽象化便無(wú)法觸及。我們的方法不依賴?yán)绯橄蠡蛘咂渌魏蔚念A(yù)先知識(shí)。NFSP 代理利用深度強(qiáng)化學(xué)習(xí)來(lái)直接從其與游戲互動(dòng)的經(jīng)驗(yàn)中學(xué)習(xí)。當(dāng)應(yīng)用在德州撲克上的時(shí)候,NFSP 實(shí)現(xiàn)了一種納什均衡,而普通的強(qiáng)化學(xué)習(xí)方法出現(xiàn)了偏離。我們還將 NFSP 應(yīng)用到 LHE,直接從原始輸入中學(xué)習(xí)。NFSP 學(xué)會(huì)了一種具有競(jìng)爭(zhēng)力的策略,基于手工抽象化實(shí)現(xiàn)了頂尖方法的運(yùn)行效果。

      2、背景

      在這個(gè)部分,我們展現(xiàn)一個(gè)對(duì)于強(qiáng)化學(xué)習(xí)方法、擴(kuò)展式博弈論表述虛擬自我對(duì)戰(zhàn)的簡(jiǎn)短概況。如需更加細(xì)節(jié)的闡述,我們推薦讀者閱讀 (Sutton & Barto, 1998), (Myerson, 1991), (Fudenberg, 1998) and (Heinrich 等人, 2015)。

      2.1. 強(qiáng)化學(xué)習(xí)(RL)

      強(qiáng)化學(xué)習(xí)(Sutton & Barto,1998)代理通常從與環(huán)境的互動(dòng)中,學(xué)會(huì)將預(yù)期的未來(lái)獎(jiǎng)勵(lì)最大化。環(huán)境通常是作為“馬爾可夫決策過(guò)程”(MDP)進(jìn)行建模。代理基于策略行動(dòng),策略具體說(shuō)明在MDP的每一個(gè)狀態(tài)中,可行行動(dòng)的分布。代理的目標(biāo)是改善自己的策略,從而最大化其收獲,是從 t 時(shí)間開(kāi)始,代理累計(jì)未來(lái)回報(bào)的一個(gè)隨機(jī)變量:ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲許多強(qiáng)化學(xué)習(xí)算法從過(guò)渡元組形式的連續(xù)“經(jīng)驗(yàn)”中學(xué)習(xí),(st ,at ,rt+1 ,st+1 ),其中 st 是 t 時(shí)間的狀態(tài),at 是這個(gè)狀態(tài)中選擇的行動(dòng),rt+1 是其后獲得的獎(jiǎng)勵(lì),st+1 是代理過(guò)渡進(jìn)入的下一個(gè)狀態(tài)。一個(gè)普遍的目標(biāo)是“學(xué)習(xí)行動(dòng)價(jià)值函數(shù)”,ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲定義為在 s 狀態(tài)、遵循 π 策略、采取 a 行為后預(yù)計(jì)獲得的獎(jiǎng)勵(lì)。如果代理學(xué)會(huì)自己正在遵循的策略,那么代理的學(xué)習(xí)是“符合策略”的。在“偏離策略”的情況下,代理從其他代理的經(jīng)驗(yàn)中學(xué)習(xí),或者學(xué)會(huì)一個(gè)其他的策略,例如一個(gè)以前的策略。

      Q-學(xué)習(xí)(Watkins & Dayan,1992)是一種流行的偏離策略強(qiáng)化學(xué)習(xí)方法。它學(xué)會(huì)貪婪策略,這在每一個(gè)狀態(tài)下采取最高預(yù)估值的行動(dòng)。通過(guò)將偏離政策強(qiáng)化學(xué)習(xí)應(yīng)用到各自的過(guò)度元組,從而將過(guò)往的經(jīng)驗(yàn)儲(chǔ)存和回放,這被稱為經(jīng)驗(yàn)回放(Lin,1992)。擬合Q值迭代(FQI)(Ernst 等人, 2005)是一種批量學(xué)習(xí)方法,用Q-學(xué)習(xí)來(lái)回放經(jīng)驗(yàn)。神經(jīng)擬合Q值迭代(NFQ)(Riedmiller,2005)和深度Q網(wǎng)絡(luò)(DQN)(Mnih 等人,2015)是FQI 的擴(kuò)展,使用分別帶有批量和在線更新的神經(jīng)網(wǎng)絡(luò)函數(shù)近似。

      2.2. 擴(kuò)展式博弈論表述

      擴(kuò)展式博弈論表述是一種涉及多個(gè)玩家的連續(xù)互動(dòng)模型。假設(shè)玩家為理性的,每個(gè)玩家的目標(biāo)是最大化自己在游戲中的收獲。在不完美信息游戲中,每個(gè)玩家至觀察到各自的“信息狀態(tài)”,換句話說(shuō),在撲克游戲中,一個(gè)玩家只知道他自己的卡片,不知道其他玩家的卡片。每一個(gè)玩家選擇一個(gè)“行為策略”,將信息狀態(tài)匹配到可選行動(dòng)的概率分布中。我們假設(shè)具有“完美回想能力”的游戲,即,每個(gè)玩家目前的信息狀態(tài)ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲包含玩家信息狀態(tài)和行動(dòng)的數(shù)列ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲這個(gè)數(shù)列將玩家?guī)肽壳暗男畔顟B(tài)。“實(shí)現(xiàn)概率”(Von Stengel,1996)ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲決定玩家 i 行為策略 πi 對(duì)實(shí)現(xiàn)信息狀態(tài)ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲有利的概率。“策略描述” π = (π1,...,πn) 是所有玩家的策略集合。π-i 指的是, π 中除了 πi 的所有策略。當(dāng)給出一個(gè)固定的策略描述 π-i,基于 π-i,玩家 i 實(shí)現(xiàn)最優(yōu)回報(bào)表現(xiàn)的策略稱為“最優(yōu)回應(yīng)”。一個(gè)近似或者 ε-最佳回應(yīng),是不超過(guò) ε 的次優(yōu)回應(yīng)。“納什均衡”是一種策略描述,其中每一個(gè)玩家的策略對(duì)于其他策略來(lái)說(shuō)是一種最優(yōu)回應(yīng)。同樣的,一個(gè)近似或者 ε-納什均衡是一種 ε-最優(yōu)的回應(yīng)。在納什均衡中,沒(méi)有哪個(gè)玩家在偏離策略的時(shí)候能有收獲。因此,納什均衡可以作為一個(gè)理性自我對(duì)戰(zhàn)學(xué)習(xí)的定點(diǎn)。實(shí)際上,納什均衡是唯一一個(gè)理性代理有望在自我對(duì)戰(zhàn)中收斂的策略描述(Bowie & Veloso,2001)。

      2.3. 虛擬自我對(duì)戰(zhàn)

      “虛擬對(duì)戰(zhàn)”(Brown,1951)是一個(gè)從自我對(duì)戰(zhàn)中學(xué)習(xí)的游戲理論模型。虛擬玩家選擇對(duì)應(yīng)對(duì)手平均行為的最優(yōu)回應(yīng)。虛擬玩家的平均策略在特定游戲類別中收斂于納什均衡,例如,雙玩家的零和游戲和多玩家潛在博弈(Robinson, 1951; Monderer & Shapley, 1996)。Leslie & Collins (2006)引入了概括化的弱化虛擬對(duì)戰(zhàn),具有與普通虛擬對(duì)戰(zhàn)相似的收斂保證,但是允許近似最優(yōu)回應(yīng)和擾動(dòng)平均策略更新,使其特別適合機(jī)器學(xué)習(xí)。

      虛擬對(duì)戰(zhàn)通常以正則形式定義,這比擴(kuò)展式博弈論表述要低效得多。Heinrich 等人 (2015) 引入了“全寬度擴(kuò)展式虛擬對(duì)戰(zhàn)”(XFP),讓虛擬玩家可以行為主義地、擴(kuò)展式地更新策略,這造成了線性時(shí)間和空間的復(fù)雜度。一個(gè)關(guān)鍵結(jié)論是,對(duì)于一個(gè)正則形式策略的凸組合,ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      我們可以獲得一個(gè)等同于實(shí)現(xiàn)的行為主義策略 δ,方法是將其設(shè)定為與對(duì)應(yīng)的實(shí)現(xiàn)概率凸組合成比例,

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      其中ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲是在信息狀態(tài) s 中策略的正則化常數(shù)。除了定義行為策略中虛擬玩家的全寬度平均策略更新,方程(1)規(guī)定了一種從此類策略的凸組合數(shù)據(jù)庫(kù)中取樣的方法。Heinrich 等人(2015)引入了“虛擬自我對(duì)戰(zhàn)”(FSP),一種基于樣本和機(jī)器學(xué)習(xí)類別的算法,可以近似 XFP。FSP 分別用強(qiáng)化和監(jiān)督學(xué)習(xí)代替了最優(yōu)回應(yīng)計(jì)算和平均策略更新。尤為重要的是,F(xiàn)SP 代理在自我對(duì)戰(zhàn)中生成自己經(jīng)驗(yàn)的數(shù)據(jù)庫(kù)。每一個(gè)代理將其經(jīng)驗(yàn)過(guò)渡元組ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲儲(chǔ)存在一個(gè)指定用于強(qiáng)化學(xué)習(xí)的記憶 MRL 中。代理自己行為的經(jīng)驗(yàn)(st,at)的儲(chǔ)存在一個(gè)分開(kāi)的記憶 MSL 中,指定用于監(jiān)督學(xué)習(xí)。自我對(duì)戰(zhàn)取樣的設(shè)定方式,讓代理的強(qiáng)化學(xué)習(xí)記憶近似一個(gè)其他玩家平均策略描述所定義的 MDP 的數(shù)據(jù)。類似地,代理的監(jiān)督學(xué)習(xí)記憶近似代理自己平均策略的數(shù)據(jù),可以通過(guò)監(jiān)督分類習(xí)得。

      3. 神經(jīng)虛擬自我對(duì)戰(zhàn)

      神經(jīng)虛擬自我對(duì)戰(zhàn)(NFSP)是 FSP 的 進(jìn)化版本,引入了多個(gè)擴(kuò)展,例如神經(jīng)網(wǎng)絡(luò)函數(shù)近似、蓄水池抽樣、預(yù)期動(dòng)態(tài)和一個(gè)完全基于代理的方法。NFSP 代理與游戲中其他玩家互動(dòng),記住自己游戲轉(zhuǎn)換的經(jīng)驗(yàn)以及自己的行為。NFSP 將這些記憶看做兩個(gè)適合深度強(qiáng)化學(xué)習(xí)和監(jiān)督分類的數(shù)據(jù)庫(kù)。代理還特別訓(xùn)練一個(gè)神經(jīng)網(wǎng)絡(luò) FQ ,使用偏離政策的強(qiáng)化學(xué)習(xí),從數(shù)據(jù)庫(kù) MRL 中預(yù)測(cè)行為值 Q(s, a)。它產(chǎn)生的神經(jīng)網(wǎng)絡(luò)定義代理的近似最優(yōu)回應(yīng)策略: β = ε-greedy (FQ),后者選擇一個(gè)概率為 ε 的隨機(jī)行為,否則則會(huì)選擇一個(gè)能夠最優(yōu)化預(yù)測(cè)行為值的行為。NFSP 代理訓(xùn)練一個(gè)分開(kāi)的神經(jīng)網(wǎng)絡(luò) FS,用監(jiān)督分類在數(shù)據(jù) MSL 上模擬自己過(guò)去的行為。這個(gè)神經(jīng)網(wǎng)絡(luò)將狀態(tài)匹配到行動(dòng)概率,并定義代理的平均策略 π = FS。游戲中代理從其兩項(xiàng)策略 β 和 π 的混合中選擇自己的行為。

      雖然虛擬玩家通常對(duì)于對(duì)手的平均策略采取最優(yōu)回應(yīng),在連續(xù)時(shí)間動(dòng)態(tài)虛擬游戲(Shamma & Arslan,2005)中,玩家基于對(duì)手的平均正則策略ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲的短期預(yù)測(cè),來(lái)選擇最優(yōu)回應(yīng)。作者顯示了這項(xiàng)基于游戲的恰當(dāng)選擇,針對(duì)均衡點(diǎn)上虛擬玩家的 η 穩(wěn)定性。NFSP 使用ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲作為這項(xiàng)預(yù)期動(dòng)態(tài)中使用的導(dǎo)數(shù)的離散時(shí)間近似。注意,ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲是常見(jiàn)離散時(shí)間虛擬游戲的正則化更新方向。為了讓一個(gè) NFSP 代理計(jì)算出近似最優(yōu)回應(yīng) βi,對(duì)于其對(duì)手的預(yù)期平均策略描述ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲代理迭代性地評(píng)估和最大化其行為值ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲實(shí)現(xiàn)的方法可以是基于和對(duì)手的預(yù)期策略 δ-i 游戲的經(jīng)驗(yàn),進(jìn)行偏離策略的強(qiáng)化學(xué)習(xí),即,Q-學(xué)習(xí)或者 DQN。為確保代理的強(qiáng)化學(xué)習(xí)記憶 MRL 包含這種經(jīng)驗(yàn),NFSP 要求所有代理從ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲中選擇他們的行為,其中 η ∈ R 被稱為“預(yù)期參數(shù)”。

      虛擬游戲通常追蹤玩家在游戲中已選的正則形式最優(yōu)回應(yīng)策略的平均值ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲。Heinrich 等人(2015)提出使用取樣和機(jī)器學(xué)習(xí)來(lái)生成數(shù)據(jù),學(xué)習(xí)正則形式策略拓展形式的凸組合。例如,我們可以生成一組數(shù)據(jù)ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲的擴(kuò)展形式,方法是從整個(gè)游戲時(shí)間中取樣,在凸組合中使用ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲與其權(quán)重 1/T 成比例。NFSP 使用蓄水池取樣(Vitter,1985;Osborne 等人,2014)來(lái)記憶自己平均最優(yōu)回應(yīng)的經(jīng)驗(yàn)。代理的監(jiān)督學(xué)習(xí)記憶 MSL 是一個(gè)蓄水池,只有當(dāng)它遵循近似最優(yōu)回應(yīng)策略 β 的時(shí)候才增加經(jīng)驗(yàn)。NFSP 代理常規(guī)性地訓(xùn)練自己的平均策略網(wǎng)絡(luò) π = FS,與自己存儲(chǔ)在自己監(jiān)督學(xué)習(xí)記憶中的平均行為相匹配,例如通過(guò)最優(yōu)化過(guò)去行為的日志概率。算法(1)呈現(xiàn)了使用 DQN 進(jìn)行強(qiáng)化學(xué)習(xí)的 NFSP。

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      算法1:使用 DQN 進(jìn)行強(qiáng)化學(xué)習(xí)的 NFSP。

      4、實(shí)驗(yàn)

      我們?cè)诘轮輷淇耍⊿outhey 等人,2005)和限制德州拿住撲克中評(píng)估 NFSP 和相關(guān)算法。我們大部分的實(shí)驗(yàn)學(xué)會(huì)策略描述的可利用性。在一個(gè)雙玩家零和游戲中,一項(xiàng)策略描述的可利用性定義為,最優(yōu)回應(yīng)描述可以獲得的期望平均回報(bào)。2δ 的可利用性至少是一個(gè) δ-納什均衡。

      4.1. XFP 的強(qiáng)度

      要理解函數(shù)近似如何與 FSP 互動(dòng),我們以一些簡(jiǎn)單實(shí)驗(yàn)開(kāi)始,模擬近似,并從全寬度算法 XFP 中獲取錯(cuò)誤樣本。首先,我們探索當(dāng)用一個(gè)靠近梯度下降的增量平均過(guò)程代替 XFP 中使用的完美平均,會(huì)有什么結(jié)果。然后,我們探索當(dāng)用一個(gè)帶 ε 誤差的近似代替 XFP 中使用的同一個(gè)查表法,會(huì)有什么結(jié)果。

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      圖1:定步長(zhǎng)對(duì)于 LHE 游戲中全寬度虛擬對(duì)戰(zhàn)表現(xiàn)的影響。

      圖1顯示了帶有默認(rèn)值 1/T 和策略更新定步長(zhǎng)的 XFP 的表現(xiàn)。我們看見(jiàn)漸進(jìn)提高了,但是針對(duì)更小步長(zhǎng)的最初表現(xiàn)變低了。對(duì)于定步長(zhǎng),表現(xiàn)似乎是達(dá)到平穩(wěn)、而非偏離。使用蓄水池取樣可以實(shí)現(xiàn)高效的定步長(zhǎng),為 1/T。但是,結(jié)果顯示指數(shù)平均的蓄水池取樣同樣可行,因?yàn)橹笖?shù)平均過(guò)往記憶會(huì)近似對(duì)應(yīng)于使用一個(gè)定步長(zhǎng)。

      定步長(zhǎng)為1的 XFP等同于一個(gè)全寬度迭代最優(yōu)回應(yīng)算法。雖然在有限完美信息雙玩家零和游戲中這個(gè)算法收斂于納什均衡,結(jié)果顯示,在不完美信息中這就不能成立了。Yakovenko 等人(2016)引入的撲克-CNN 算法存儲(chǔ)少量過(guò)往策略,基于這些策略迭代性地計(jì)算新策略。代替那個(gè)集合中的策略類似于更新一個(gè)具有很大定步長(zhǎng)的平均策略。這有可能導(dǎo)致類似圖1中顯示的問(wèn)題。

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      圖2:當(dāng) LHE 游戲在最優(yōu)回應(yīng)計(jì)算中加入均勻隨機(jī)噪音,XFP 的表現(xiàn)。

      我們的 NFSP 代理在他們的策略中加入隨機(jī)探索,使用噪音隨機(jī)梯度來(lái)學(xué)習(xí)行動(dòng)價(jià)值。因此,我們研究了在最優(yōu)回應(yīng)計(jì)算中加入隨機(jī)噪音的影響,XFP 通過(guò)動(dòng)態(tài)編程來(lái)運(yùn)行最優(yōu)回應(yīng)計(jì)算。在逆向歸納法的每一步,我們傳回一個(gè)帶有概率 ε 的均勻隨機(jī)行動(dòng)的值,否則則傳回最佳行動(dòng)的值。圖2顯示出,增加噪音時(shí)表現(xiàn)清一色地下降。但是,表現(xiàn)仍保持穩(wěn)定,對(duì)于所有噪音等級(jí)來(lái)說(shuō)都持續(xù)改善。

      4.2. NFSP的收斂

      我們實(shí)證研究了在 LHE 游戲中 NFSP 收斂至納什均衡。我們還研究了去除或改變一些 NFSP 的組成部分是否會(huì)打破收斂。

      我們的一項(xiàng)目標(biāo),是將對(duì)過(guò)往知識(shí)的依賴性最小化。因此,我們希望定義一個(gè)撲克游戲中信息狀態(tài)的目標(biāo)編碼。與其他計(jì)算機(jī)撲克的研究不同(Zinkevich 等人, 2007; Gilpin 等人, 2007; Johanson 等人, 2013),我們不進(jìn)行任何高層級(jí)特征的工程。撲克游戲通常包含很多輪。在每一輪,新卡片發(fā)給玩家。我們將每一輪的卡片用一個(gè)“n 個(gè)中的第 k 個(gè)”編碼來(lái)表征,例如,當(dāng) LHE 有一疊52張卡片,第二輪發(fā)出三張新卡。這樣,這一輪的編碼就使用長(zhǎng)度為52的矢量和三個(gè)設(shè)為1的元素,其余元素設(shè)為0。在 LHE 撲克游戲中,玩家通常有3種可選的行為,即 {棄牌、根注、加注} 。注意,根據(jù)情景而定,跟注和加注可以分別稱為“讓牌”和“押注”。押注限制在每輪固定數(shù)量的加注之內(nèi)。這樣,我們可以將押注歷史表征為一個(gè)4維度的張量,即 {玩家、輪數(shù)、加注數(shù)量、采取行動(dòng)} 。也就是說(shuō),單挑 LHE 游戲中包含2個(gè)玩家、4輪、每輪0-4次加注和3個(gè)行動(dòng)。這樣,我們可以將一個(gè) LHE 押注歷史表征為 2 x 4 x 5 x 3 張量。在單挑游戲中,我們不需要編碼棄牌行為,因?yàn)槿绻环椒艞売螒蚓徒Y(jié)束了。這樣,我們可以將4維張量扁平化,成為一個(gè)長(zhǎng)度為80的矢量。將4輪的卡牌都聯(lián)接起來(lái),我們就可以將一個(gè) LHE 的信息狀態(tài)編碼為一個(gè)長(zhǎng)度為288的矢量。相似地,一個(gè) LHE 的信息狀態(tài)可以編碼為一個(gè)長(zhǎng)為30的矢量,因其包含6種卡片以及3個(gè)重復(fù)卡片、2輪、每輪0-2次加注以及3次行動(dòng)。

      要實(shí)現(xiàn) LHE 中的學(xué)習(xí),我們將 NFSP 手動(dòng)校準(zhǔn)為一個(gè)完全聯(lián)接的神經(jīng)網(wǎng)絡(luò),帶有1個(gè)隱含層、包含63個(gè)神經(jīng)元和線性激活。然后,我們重復(fù)各種具有相同參數(shù)的神經(jīng)架構(gòu)的實(shí)驗(yàn)。我們特別設(shè)置記憶大小為200K,MRL 和 MSL 分別為2M。MRL 的功能是一個(gè)環(huán)形緩沖器,包含一個(gè)最近的經(jīng)驗(yàn)。MSL 用蓄水池取樣更新。強(qiáng)化學(xué)習(xí)率和監(jiān)督學(xué)習(xí)率分別設(shè)置為為 0.1 和 0.005,兩者都使用隨機(jī)梯度下降(SGD),沒(méi)有神經(jīng)網(wǎng)絡(luò)隨機(jī)最優(yōu)化的趨勢(shì)。每一個(gè)代理進(jìn)行3次隨機(jī)梯度更新,游戲中每128步、每個(gè)神經(jīng)網(wǎng)絡(luò)中最小批次數(shù)量為128。DQN 算法的目標(biāo)網(wǎng)絡(luò)每300次更新就重新調(diào)整。NFSP 的預(yù)期參數(shù)設(shè)置為 η = 0.1。ε-貪婪策略的探索從 0.06 開(kāi)始,下降到0,與迭代次數(shù)的逆平方根成比例。

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      圖3:LHE 游戲中的 NFSP 的學(xué)習(xí)表現(xiàn)。

      圖3顯示了對(duì)于各種網(wǎng)絡(luò)架構(gòu), NFSP 趨近納什均衡。我們觀察到隨著網(wǎng)絡(luò)數(shù)量的增加,表現(xiàn)也清一色地增加。NFSP 實(shí)現(xiàn)了0.06的利用性,而全寬度 XFP 通常在1000輪全寬度迭代才能實(shí)現(xiàn)。

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      圖4:通過(guò)去除必須的 NFSP 組成部分,打破 LHE 游戲中的學(xué)習(xí)表現(xiàn)。

      為了研究 NSFP 各種組成部分的相關(guān)度,也就是說(shuō),蓄水池取樣和期望動(dòng)態(tài),我們進(jìn)行了一個(gè)分離他們效果的實(shí)驗(yàn)。圖4顯示,這些變動(dòng)導(dǎo)致表現(xiàn)下降。特別是使用固定大小的滑動(dòng)窗口來(lái)儲(chǔ)存代理自己行為的經(jīng)驗(yàn),會(huì)導(dǎo)致偏離。對(duì)于一個(gè)0.5的高期望參數(shù),NFSP 的表現(xiàn)進(jìn)入了停滯。最終,使用指數(shù)平均蓄水池取樣進(jìn)行監(jiān)督學(xué)習(xí)記憶更新,導(dǎo)致了噪音表現(xiàn)。

      4.3. 與DQN比較

      之前已有多個(gè)穩(wěn)定算法提出過(guò)用于深度強(qiáng)化學(xué)習(xí),尤其是 DQN 算法(Mnih 等人,2015)。但是,這些算法的實(shí)證穩(wěn)定性之前只在單一代理、完美(或接近完美)信息 MDP 中建立過(guò)。這里,我們研究與 NFSP 相比,在多代理、信息不完美游戲中的 DQN 穩(wěn)定性。

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      圖5:在 LHE 游戲中比較 DQN 的表現(xiàn)。

      DQN 學(xué)會(huì)一種決定論的貪婪策略。這在 MDP 中足夠進(jìn)行最優(yōu)行為,算法就是為此而設(shè)計(jì)的。不過(guò),在信息不完美游戲通常要求最優(yōu)行為的隨機(jī)策略。這樣,除了 DQN 的 ε-貪婪策略,我們將其行為存儲(chǔ)在一個(gè)監(jiān)督學(xué)習(xí)記憶 MSL 中,并學(xué)習(xí)其平均行為。這項(xiàng)平均策略不影響 DQN 的實(shí)施行為,因?yàn)樗鼜膩?lái)不會(huì)被執(zhí)行。我們通過(guò)使用帶有期望參數(shù) η = 1 的 NFSP,來(lái)實(shí)施這個(gè) DQN 變量。我們將 DQN 大部分參數(shù)設(shè)置為與之前部分實(shí)驗(yàn)中的 NFSP 相同。這是為了讓監(jiān)督學(xué)習(xí)參數(shù)不直接影響 DQN 的表現(xiàn)。我們用以下所有參數(shù)的組合來(lái)訓(xùn)練 DQN:學(xué)習(xí)比例 {0.2,0.1,0.05},衰減探索開(kāi)始于 {0.06,012},增強(qiáng)學(xué)習(xí)記憶 {2m蓄水池,2m滑動(dòng)窗口}。然后,我們選擇 DQN 表現(xiàn)最優(yōu)的結(jié)果,將其與之前部分實(shí)驗(yàn)中的 NFSP 表現(xiàn)相比較。DQN 在學(xué)習(xí)比例為0.1、探索從0.12開(kāi)始和滑動(dòng)窗口記憶為2m的時(shí)候,實(shí)現(xiàn)其最佳表現(xiàn)結(jié)果。

      圖5顯示,DQN的決定論策略是高度可利用的,這是可以預(yù)見(jiàn)的,因?yàn)樾畔⒉煌昝烙螒蛲ǔR箅S機(jī)策略。DQN 的平均行為也沒(méi)有趨近納什均衡。這值得注意,因?yàn)?DQN 將其經(jīng)驗(yàn)存儲(chǔ)在一個(gè)回放記憶中,因此會(huì)高效地學(xué)會(huì)對(duì)手的平均行為,只要其回放記憶足夠大,可以對(duì)它進(jìn)行追蹤。這與虛擬對(duì)戰(zhàn)很像。但是,因?yàn)?DQN 代理在自我對(duì)戰(zhàn)中使用 ε-貪婪策略,它們的經(jīng)驗(yàn)隨著時(shí)間高度相關(guān),集中在一個(gè)狀態(tài)子集。我們相信這是 NFSP 在我們?cè)囼?yàn)中表現(xiàn)更好的主要原因。NFSP 代理在自我對(duì)戰(zhàn)中使用一種改變更慢的平均策略。這樣,它們的經(jīng)驗(yàn)改變更慢,導(dǎo)致它們的記憶中包含更穩(wěn)定的數(shù)據(jù)分布。這會(huì)幫助它們訓(xùn)練神經(jīng)網(wǎng)絡(luò),并適應(yīng)彼此。其他常見(jiàn)的強(qiáng)化學(xué)習(xí)方法都被證明在撲克游戲中具有類似的停滯表現(xiàn)(Ponsen 等人,2011; Heinrich & Silver, 2015)。

      4.4. 限制德州拿住 (LHE)

      我們將 NFSP 應(yīng)用于非常流行的 LHE 游戲。2008年,一個(gè)計(jì)算機(jī)程序第一次在公開(kāi)競(jìng)賽中打敗了人類 LHE 玩家,從此現(xiàn)代計(jì)算機(jī)代理被廣泛認(rèn)為實(shí)現(xiàn)了超人表現(xiàn)(Newall,2013)。這種游戲由 Bowling等人(2015)根本上解決。我們用 SmooCT 來(lái)評(píng)估我們的代理,這是一個(gè)在2014年年度計(jì)算機(jī)撲克競(jìng)賽(ACPC)中獲得了三項(xiàng)銀牌的 Smooth UCT (Heinrich & Silver,2015)代理。學(xué)習(xí)表現(xiàn)以 mbb/h 來(lái)衡量,換句話說(shuō),在每一手最開(kāi)始的時(shí)候玩家大盲注的千分之一。

      我們手動(dòng)校準(zhǔn)了 NFSP,嘗試了9種配置。我們用以下的參數(shù)實(shí)現(xiàn)了最優(yōu)表現(xiàn)。神經(jīng)網(wǎng)絡(luò)完全聯(lián)接,有4個(gè)隱藏層,分別有1024、512、1024和512個(gè)具有線性激活的神經(jīng)元。MRL和MSL的記憶容量分別設(shè)定為600k和30m。MRL作為環(huán)形緩沖器,包含一個(gè)近期經(jīng)驗(yàn)。MSL用指數(shù)平均的蓄水池取樣(Osborne等人,2014)更新,用最低概率0.25代替MSL中的條目。我們使用沒(méi)有強(qiáng)化學(xué)習(xí)和監(jiān)督學(xué)習(xí)趨勢(shì)的 SGD,將學(xué)習(xí)比例分別設(shè)置為0.1和0.01。每一個(gè)代理進(jìn)行2次隨機(jī)梯度更新,游戲中每256步、每個(gè)網(wǎng)絡(luò)的最小批次大小為256。DQN 算法的目標(biāo)網(wǎng)絡(luò)是每1000次更新就重新調(diào)整。NFSP的預(yù)期參數(shù)設(shè)置為 η = 0.1。ε-貪婪策略的探索從0.08開(kāi)始,衰退至0,比在 LHE 中更慢。除了 NFSP 的主要平均策略描述,我們還評(píng)估了最優(yōu)回應(yīng)和貪婪平均策略,它們決定論地分別選擇最大化預(yù)期行動(dòng)值或者概率的行動(dòng)。

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      圖6:與 SmooCT 對(duì)戰(zhàn)的表現(xiàn)。每次評(píng)估的標(biāo)準(zhǔn)誤差小于 10 mbb/h。

      為了在單挑 LHE 中提供一些勝率的直覺(jué),永遠(yuǎn)棄牌的玩家會(huì)損失 750 mbb/h,人類專家玩家在在線高風(fēng)險(xiǎn)游戲中通常達(dá)到40-60 mbb/h 的預(yù)期勝率。類似的,在2014 ACPC中,表現(xiàn)前一半的計(jì)算機(jī)代理自己實(shí)現(xiàn)了最高 60 mbb/h 的預(yù)期勝率。在訓(xùn)練中,我們基于 SmooCT 周期性地評(píng)估 NFSP 的表現(xiàn),每一個(gè)都玩25000手。圖6呈現(xiàn)了 NFSP 的學(xué)習(xí)表現(xiàn)。NFSP 的平均和貪婪平均策略描述顯示了一個(gè)穩(wěn)定、相對(duì)統(tǒng)一的表現(xiàn)改善,并分別實(shí)現(xiàn)了大約-50 mbb/h 和-20 mbb/h 的勝率。最優(yōu)回應(yīng)策略描述在每次表現(xiàn)中體現(xiàn)了更多的噪音,大部分在 -50 到 0 mbb/h 的范圍內(nèi)。我們還基于2014 ACPC中的前三名,評(píng)估了最終貪婪平均策略。表格1呈現(xiàn)了結(jié)果。

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      表格1

      5. 相關(guān)研究

      依賴人類專家知識(shí)可能會(huì)很昂貴,而且如果知識(shí)是次優(yōu)的,可能會(huì)受到人類偏見(jiàn)和限制的影響。但是,許多已經(jīng)應(yīng)用在游戲中的方法都依賴人類專家的知識(shí)。深藍(lán)在象棋中使用人類制造的評(píng)估函數(shù)(Campbell等人,2002)。在計(jì)算機(jī)圍棋中,Maddison等人(2015)和Clark & Storkey (2015)用人類專家下棋的數(shù)據(jù)來(lái)訓(xùn)練深度神經(jīng)網(wǎng)絡(luò)。在計(jì)算機(jī)撲克中,目前的游戲理論方法使用啟發(fā)式方法來(lái)理解卡片強(qiáng)度,從而將游戲抽象至可以駕馭的規(guī)模(Zinkevich等人, 2007; Gilpin等人, 2007; Johanson等人,2013)。Waugh等人(2015)最近將其中一種方法與函數(shù)近似相結(jié)合。然而,他們的全寬度算法必須暗中推導(dǎo)每一次迭代中的所有信息狀態(tài),這在大的領(lǐng)域來(lái)說(shuō)過(guò)于昂貴。與之相比,NFSP 專注在基于樣本的強(qiáng)化學(xué)習(xí)設(shè)定,其中游戲的狀態(tài)不需要全部列舉,學(xué)習(xí)者甚至不需要有一個(gè)游戲動(dòng)態(tài)的模型。

      許多游戲中的成功應(yīng)用依賴本地搜索(Campbell等人,2002;Browne等人,2012)。本地搜索算法在游戲中,實(shí)時(shí)、有效地計(jì)劃決策,例如通過(guò)蒙特卡洛模擬或者有限深度逆向歸納法。但是,常見(jiàn)的基于模擬的本地搜索算法應(yīng)用在信息不完美的撲克游戲中時(shí),已經(jīng)證實(shí)會(huì)偏離(Ponsen等人,2011;Heinrich & Silver,2015)。而且,即便是游戲理論方法在信息不完美游戲中進(jìn)行本地規(guī)劃時(shí),通常也沒(méi)法實(shí)現(xiàn)不可利用的行為(Burch等人,2014;Ganzfried & Sandholm,2015;Lisy等人,2015)。本地搜索的另一個(gè)問(wèn)題是,如果沒(méi)有注入原有知識(shí)來(lái)引導(dǎo)搜索,實(shí)時(shí)運(yùn)行的成本有可能非常巨大。這引發(fā)了如何獲得這種原有知識(shí)的問(wèn)題。Silver等人(2016)用人類專家數(shù)據(jù)訓(xùn)練了卷積神經(jīng)網(wǎng)絡(luò),然后使用一個(gè)自我對(duì)戰(zhàn)強(qiáng)化學(xué)習(xí)過(guò)程來(lái)進(jìn)一步優(yōu)化這些網(wǎng)絡(luò)。通過(guò)使用這項(xiàng)神經(jīng)網(wǎng)絡(luò)來(lái)引導(dǎo)高性能本地搜索,他們戰(zhàn)勝了圍棋大師。在這項(xiàng)研究中,我們不使用任何實(shí)時(shí)本地搜索來(lái)評(píng)估我們的代理。如果可以開(kāi)發(fā)針對(duì)信息不完美游戲的本地搜索方法,NFSP 訓(xùn)練的策略可以是引導(dǎo)搜索的一個(gè)好選擇。

      納什均衡是理性代理可以在自我對(duì)戰(zhàn)中有望收斂的唯一策略描述(Bowling & Veloso,2001)。TD-Gammon(Tesauro,1995)是一個(gè)世界級(jí)別的西洋雙陸棋代理,它的主要組成部分是一個(gè)用自我對(duì)戰(zhàn)強(qiáng)化學(xué)習(xí)訓(xùn)練的神經(jīng)網(wǎng)絡(luò)。雖然其算法基于臨時(shí)差異學(xué)習(xí),在雙玩家、信息完美的零和游戲中是可行的,可是在不完美游戲中總體來(lái)說(shuō)不能收斂。DQN(Mnih等人,2015)結(jié)合了臨時(shí)差異學(xué)習(xí)、經(jīng)驗(yàn)回放和深度神經(jīng)網(wǎng)絡(luò)函數(shù)近似。它在大部分Atari游戲中實(shí)現(xiàn)了人類等級(jí)的表現(xiàn),從原始感覺(jué)輸入中學(xué)習(xí)。但是,這些Atari游戲的設(shè)定是單一代理環(huán)境,潛在對(duì)手固定,并由Atari模擬器控制。我們的實(shí)驗(yàn)顯示,DQN 代理在 LHE 游戲中沒(méi)法實(shí)現(xiàn)納什均衡,其中玩家允許進(jìn)行動(dòng)態(tài)適應(yīng)。Yakovenko等人(2016)在計(jì)算機(jī)撲克對(duì)戰(zhàn)中訓(xùn)練了深度神經(jīng)網(wǎng)絡(luò),包括兩個(gè)在人類中非常流行的撲克游戲。他們的網(wǎng)絡(luò)與基于啟發(fā)式方法和簡(jiǎn)單的計(jì)算機(jī)程相比表現(xiàn)更強(qiáng)。人類專家玩家可以超越他們的代理,雖然其樣本大小不具有統(tǒng)計(jì)學(xué)意義。他們的方法在現(xiàn)實(shí)或理論中是否會(huì)收斂是個(gè)未知數(shù)。與之對(duì)比,我們實(shí)證證明了 NFSP 在 LHE 游戲中收斂至近似納什均衡。而且,我們的方法是有原則的,是基于擴(kuò)展式博弈論表述中的虛擬對(duì)戰(zhàn)理論。

      6、結(jié)論

      我們引入了 NFSP,第一個(gè)端到端深度強(qiáng)化學(xué)習(xí)方法,在不完美信息游戲中以自我對(duì)戰(zhàn)學(xué)習(xí)近似納什均衡。NFSP 解決三個(gè)問(wèn)題。

      首先,NFSP 代理學(xué)習(xí)不需要具備原有知識(shí)。

      第二,他們不依賴于實(shí)時(shí)本地搜索。

      第三,他們?cè)谧晕覍?duì)戰(zhàn)中收斂至近似納什均衡。我們的實(shí)證結(jié)果提供了以下收獲:虛擬游戲的表現(xiàn)隨著各種近似錯(cuò)誤優(yōu)雅地衰退;NFSP 在小撲克游戲中能可靠地收斂于近似納什均衡,而 DQN 的貪婪和平均策略不能;NFSP 在真實(shí)世界規(guī)模的信息不完美游戲中,從零學(xué)會(huì)一種有競(jìng)爭(zhēng)力的策略,不需要使用明確的原有知識(shí)。

      在這項(xiàng)研究中,我們專注于信息不完美的雙玩家零和游戲。但是,虛擬對(duì)戰(zhàn)在合作性的潛在游戲中,也能保證收斂至納什均衡。因此我們可以看到,NFSP 也可以成功應(yīng)用于這些游戲。而且,連續(xù)動(dòng)作強(qiáng)化學(xué)習(xí)的最近進(jìn)展(Lillicrap等人,2015)可以讓 NFSP 應(yīng)用于連續(xù)動(dòng)作游戲,這是目前的游戲理論方法沒(méi)法直接解決的問(wèn)題。

      via ICML

      ICML論文|阿爾法狗CTO講座: AI如何用新型強(qiáng)化學(xué)習(xí)玩轉(zhuǎn)圍棋撲克游戲

      雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見(jiàn)轉(zhuǎn)載須知

      分享:
      相關(guān)文章
      當(dāng)月熱門(mén)文章
      最新文章
      請(qǐng)?zhí)顚?xiě)申請(qǐng)人資料
      姓名
      電話
      郵箱
      微信號(hào)
      作品鏈接
      個(gè)人簡(jiǎn)介
      為了您的賬戶安全,請(qǐng)驗(yàn)證郵箱
      您的郵箱還未驗(yàn)證,完成可獲20積分喲!
      請(qǐng)驗(yàn)證您的郵箱
      立即驗(yàn)證
      完善賬號(hào)信息
      您的賬號(hào)已經(jīng)綁定,現(xiàn)在您可以設(shè)置密碼以方便用郵箱登錄
      立即設(shè)置 以后再說(shuō)
      主站蜘蛛池模板: 巜饥渴的人妻与维修师傅电影| 办公室刺激战场一共几集| 新金甁梅龚玥菲| 清华少儿英语| 《电影灭火女警2》| 莫莉特别的酒店| 电影登山的目的| 赌神1电影| 男生女生相愁愁愁电视剧在线观 | 江南锄奸| 张响神枪电视剧全集| 《谍战深海之惊蛰》电视剧| 需要爸爸播种种子| 一拳超人最强之男觉醒 | 好先生 番外篇| 投行风云 第四季全集观看| 村妓K8经典网| 土默特右旗| 新闻联播回放今天| 查泰莱夫人的| 男按摩师做乳房按摩在线观看| 聊斋艳谭叶子楣| 奥伊米亚康村| 水润女人韩国电影在线观看| 电影法国空乘| 大水井风云| 长空雄鹰| 种马猎人美国电影在线观看| 唐老鸭和米老鼠全集| 与我同眠下载| 封神英雄榜第二部1| 大丈夫电视剧全集48免费完整版| 王月天!激情小说| 丫鬟逆袭全集免费| 热带雨 完整版时长| 魔咒女王| 巜色诱女教师4在线播放| 数学书上最恐怖一页| 回心转意伴奏| 小早川怜子电影| 高清《英雄》在线观看完整版| 都市护花:退役兵王短剧全集| 老公的部下是初恋| 电视剧真爱诺言| 舍我其谁| 站着再来一次48集分集剧情介绍 | 《731》电影结局| 《女演员:性试镜》免费观看| 西班牙五十掌中之物| 绝世网红韩剧| 《西虹市首富》电影| 壮志凌云女版法国满天星在线观看完 | 清华长庚医院付猛医生| 风云传奇剧情介绍| 网友吃席发现每人面前都是盒饭 | 坎贝奇第三部曲无憾免费播放| 大独裁者| 裸婚时代第二部| 妻子8免费全集在线观看| 日本电影人证| 豪斯医生| 义姐是不良妈妈动漫第一季全集| 奥美迦奥特曼中文版| 荣誉法则(成人版)| 法国满天星《古墓丽影| 我的好妈妈高清中字在线观看免费| 平凡之路电视剧免费| 凶猛的办公室日本动漫电影 | 部长的老婆 双字ID| 百万巨鳄电影完整版| 请和我老公结婚 日剧| 美容院特殊待遇2| 人民的名义 电视剧| 老千全集完整版免费观看| 新奥特曼 在线观看| 郭晓冬郝蕾| 丈夫不在部长来家做客| 归路电视剧在线观看全集| 巾帼枭雄国语| 麦乐迪《森林》免费观看| 门事件电影直播| 偷欲(出轨炮H)| 动感之星| 挚爱游戏樊治欣全集免费观看| 一个可以在线观看的免费| 男生女生一愁愁愁电视剧在线观看30分 | 玄奘之路纪录片| 甄嬛传片花| 喜剧电影爆笑| 正者无敌演员| 古墓丽影山寨版免费观看| 辽宁卫视网络直播| 婚姻时差电视剧全集免费观看| 满天星在线播放完整版| 野花全集未删减版| 敢死队1| 迷人的小峓子HD完整点| 我的妻子韩剧| 四个少夫按摩精油伦理片| 91密桃| 单身首尔电影| 别对我说谎第一季| 部长来家电影| 恶魔奶爸2季| 白万新娘之爱无悔| 法国女仆在线观看完整免费高清原声满天星奔跑吧 | abo动画成结模拟免费观看| 《红高粱》电视剧| star-464| 被义子侵犯BD中文字幕| 危险关系电影完整版| 终极一班2全集下载| 黑白配国语在线播放观看| 《姐妹新娘》全集观看| 核桃成熟时李丽珍| 日本性生活电影| 再喊一声爹娘| 一路向西的女主角| 纯白色之恋| 中医经筋捆扎疗法视频| 等不及在车里做一次核酸检测 | 大蟒蛇2| 太子发疯地撞着公主的小说| 美乃雀电影在线观看全集| 第一次亲密接触演员表| 紫川第二季| 酒店服务生在线观看完整免费高清第一集 | 女子护卫队1973在线观看| 人民万岁电影| 最后征战电视剧| 中央财办:经济已挺过最困难时刻| 在线播放免费观看全集电视剧 | 闪光夫妇全集高清| 《咱们结婚吧》全集| 暴躁老妈和二姨| 女房东的秘密 韩国电影在线观看| 假小子电影| 暗潮危机电影完整版在线观看| 爸爸的种子在线| 复仇者联盟字幕| 儿歌乐园| 绝密押运18| 舒淇的献身集| 电影《美容院的特殊待遇| 仙逆104全集完整正版| 特殊的保险销售员8| 冰河时代2| 满天星凌云壮志女版| 任达华舞男| 好好说话在线观看免费完整版 | 凡人修仙传77集免费观看全集| 神奇女侠成人H版在线| 哥谭第二季| 柯南国语版爱奇艺| 麦乐迪家庭矛盾在线观看| 最后一滴血2| 《家庭矛盾》melody在线| 越狱 最后一越| 凤凰传奇跨年演唱会| 西部狂野满天星| 江苏卫视脱颖而出| 满天星电影在线观看完整免费| 小泽玛利亚 bt| 朴妮唛29分钟完整版| 战神3中文版下载| 一脸嫌弃给你看胖第一季免费观看 | 升旗仪式流程| 幽暗沼泽| 苦尽甘来的遇见你韩剧| 香醇的绣感完整版| 打开你会回来感谢我的在线播放| 束缚游戏免费全集在线看| 谁在说谎| 还珠格格第1部全集| 你是我生命的一首歌| 李丽珍主演的电影免费观看国语 | 未来日记动漫| 《部长出差的日子》电影| 今天是个好日子舞蹈| 麦乐迪女超人免费在线观看| 请成为我的家人免费全集在线观看| 暮光之城:破晓(上)| 司藤电视剧在线观看免费| 低苦艾乐队| 四个男人要轮流练瑜伽是什么电影 | 头文字d电影粤语| 天龙八部主题曲| 表妹在线播放| 凌源市| 《妥协》短剧免费观看| 酒店1—80全集免费完整版| 朋友的妈妈中语版| 李时珍电影在线观看| 日本战狼20免费播放最新一期| 大连晓芹海参| 千金肉板栗完整版| 秘书在办公室被躁BD在线小说| 法国女超人免费| 钢铁侠战甲被盗| 黑天使快播| 魔人扎克| 聚会的目的在线观看bd高清| 战狼6女版免费观看完整版| 济公传奇2| 双女任务满天星法版免费观看| 来不及说我爱你免费观看完整版| 养母的花样年华| 13一14chinesex破| 等着你回来粤语| 豫剧桃花庵| 菠萝蜜菠萝菠萝| 台剧《浪漫女家教》黛比在线观看| 燕窝多少钱一斤2023年价格| 房屋销售电影在线观看完整版| 冰激凌怎么画最好看| 寻梦环游记中文免费版普通话| 出轨的女人电影| 鲁滨逊漂流记 电影| 美国式1982版保罗| 梦回青河| 沙漠女性治疗营2| 迷人的保姆3线观高清| 《新人类毒医肥尸》在线观看 | 熊出没之逆转时空大电影| 欧美裸体电影| 冰封(重生之门)| 猛鬼食人胎| 环太平洋字幕| 女孩1小时接10个客| 和表姐同居免费观看| 《流浪地球》樱花动漫| 销售的销售秘密2HD中字国| 伍佰在苏州演唱会累惨了| 二对一商务模式2聚集| 最后一刻| 睫毛膏1983美国电影在线观看| 黄绮珊骄傲| 婚姻攻略免费观看全集| 龙王传说3第四季| 斗罗大陆免费完整观看174| 正蓝旗| 无声电影免费观看普通话| 坎贝奇三部曲《品味人生》完整版 | 边水往事连续剧免费观看全部| 战狼6高清资源下载| 因为爱情有幸福之一电视剧| 人马配速90分钟电视剧| 河南坠子小八义| 沉睡花园一共多少集| 马志明 大保镖| 甜蜜的家第二季| 孤雁电视剧| 魔法老师下载| 罪恶王冠19| 变形金刚2高清| 坎贝奇的品味人生观看 | 武器a恶心恐怖截图| 奔跑吧兄弟黄河篇免费观看| 酒店1-40集在线观看| 都市狂少:纵横都市无人敌全集免费| aj网站大全免费| 金钱之味快播| 生死决断秋瓷炫几分出场| 黄曼巴罗伊| (女学生的滋味)hd| 南沙群岛在线| 秘密花园国语版| 王牌杀姬免费观看完整版| 搬山道人免费观看完整版| 泉水叮咚响广场舞| 上将许世友下载| 19岁大学生免费观看电视剧中文版 | 古剑奇谭第十集| 交换3国语版普通话| 张本智和教练:没什么好耻辱的| 新扎师妹2粤语| 暴躁太子爷| 《杜塞》| 仁心解码2 国语版| 中国好声音之为你转身| 电影东方| 高清《催眠术》樱花动漫 | 啄木鸟伍迪在线观看| 妹妹好色网| 戴口罩剧烈运动或引发猝死| 爱情公寓第五季观看免费| 新红楼梦主题曲| 顶楼电视剧在线观看| 初代奥特曼中文版全集免费观看| 李伯清散打评书| 沧州绝招| 美国禁忌睫毛膏8| 真爱永恒电视剧| 21世纪在线观看免费播放 | 荷兰空姐2019年上映的日本空姐是谁 | 断掌顺娘电视剧免费观看| 地道战全集| 电影奇门遁甲在线观看免费完整版| 好男人在线观看完整版| 怒火重案在线观看免费完整版 | 双龙出手百度影音| 校霸在小树林请我吃麻辣烤肠| 夏家三千金第一部| 凡人修仙传动漫4K高清版| 变形金刚2国语版免费观看| 菲律宾电影:赤裸大胆| 还珠格格电视剧全集免费观看 | 大敌当前电影| 不系纽扣的女孩| 蜀南竹海门票| 猩疯血雨电影| 《卖保险的女销售》3| 鬼灭之刃决战无限城免费完整版| 按摩店的特殊待遇在线观看| 目之所及| 我和女部长一起去旅行的电影| 咒术回战第三季在线观看| 八尺夫人满天星版英文版观看| 高清《诱人的护士》韩国| 被部长玩弄的女秘书在线观看| 天幕下的恋人粤语03| g点电影完整版在线观看| 被合租刑警的粗汉肉H高NP| 《我的私人游戏教练》| 灌篮高手全国大赛篇| H版欧美成人版白雪公主| 被害空姐| 两个好媳妇中文版本免费观看全集| 明星的恋人电视剧| 金银1-5普通话少女潘| 《惊变28年》| 皇太子的初恋国语版全集| 电影《美容院的特殊待遇》纹身女演 | 金银5-10集全集免费观看下载 | 杨门虎将电视剧| 礼仪老师韩国电影完整版| 盛夏晚晴天电视剧| 十七岁高清在线播放免费| 公公浮的手| 三代响马| 星克莱尔全集在线| 红娘子大结局| 《销售秘密2》在线观看中文| 西出玉门电视剧免费观看完整版 | 电影《莫陌1》在线观看免费| 我年轻瘦子8| 科洛斯风云| 妻子的谎言大结局剧情| 种地吧第一季全集完整免费| 苹果2007年电视剧免费观看| 四大名捕会京师攻略| 乡村里的中国 纪录片| 花千骨日剧第二部在线观看| 乱世奇侠之骗侠| 《黎巴嫩》| 俘虏之锁1-2集在线观看| 我的丑娘剧情介绍| 战狼6在线观看高清版免费完整版| 仙逆年番第二部| 坎贝奇《品味人生》在线播放 | 波吉亚家族电影| 暗花国语| 电影《灭火宝贝1》在线电影| 初体验3在线| 高压监狱2019满天星法版免费| 叶子楣 女机械人| 性的暴行在线观看| 开心公寓| 漂亮的小姨韩剧免费观看| 格莱美金曲| 黑帮大佬365日| 冰路营救在线观看| 午夜寂寞影院安卓香港版| 连续剧甄嬛传| 美丽小蜜桃美国| 尖峰时刻2国语版| 电影塔日酒店完整版满天星| 欧美灭火宝贝在线观看完整版| 水电维修工的绝遇2| 《神话》| 新婚初夜| 黑暗荣耀1| 黑道女金钗| 小蓝在线播放| 相思蛊电视剧| 激战丛林意大利1995完整电影版在线 | 高清《向流星许愿的我们》电视剧| 无颜之月免费看| 肮脏电影| 高清在韩国成为房主的方法未删减| 电视剧胜算全集免费观看| 名媛望族40集免费完整版| 玉蒲团3| 残奥会主题曲| 韩剧《情欲校园》车永莉版| 中国油价处在世界什么水平| 电影《灭火宝贝1》免费观看全集高清| 忘年恋曲电影| 保罗一家1-4美国版免费观看| 美女拳击赛| 快乐到家迅雷下载| 复仇者联盟4完整在线观看| 太阳之歌女主角| 替夫还债3在线观看完整版中文电影| 辣妹刺客2正片完整版在线观看| 姜素拉金牌销售的秘密2| 熊出没之过年2部| 不义姐| 古装三圾片| 兰姨悄悄关上房门去了次卧| 千人斩在线观看| 钟馗传说| 混战两姐妹4免费观看中文版| 一家人不说两家话| 姐妹牙医完整版高清| 绽放电视剧全集免费观看| 公浮之手中2完整版中文 | 天美影院| 心动 电影| 天师与妖姬| 匿杀未删减| 村暖花开2完整版免费观看| 金银梅1一5普通话选| 神偷奶爸1国语版免费完整版| 睫毛膏1983在线观看完整版| 电竞冠军:少女带队全集免费| 免费观看三年大片完整版电影| 更衣服人偶坠入爱河 在线观看| 高清小先知| 李卫当官第一部免费版央视网| 武庚纪在线观看| 嘎啦电影节| 杨光的爱情故事2| 炸天小姐1980免费观看| 插曲的痛30集全集免费观看剧情介绍妇女| 吕剧大全| 生死兄弟情电视剧| 《乳头按摩》在线观看| 恶搞之家在线观看免费完整版| 美丽小蜜蜂5大结局| 电视剧向东是大海| 我女友的妈妈韩国| 一刀不剪| 温柔地杀我电影| 安徽卫视回放| 双子星公主 第一部| 《可疑诊疗室:特殊待遇》中文版| adn-018| 美乃雀电影免费全集在线播放| amg动漫| 大叔小馆第1季完整版| 儿子与情人免费播放| 淬火年代免费观看全集播放| 酒店1-80集全集免费| 美妙旋律第二季44| 次板栗电影千金大小姐| 四个少夫按摩精油伦理片| 宝山区| 我兄弟的母亲免费观看电视剧| 高清《高校教师》日本电影| 卢克凯奇在线观看| 没有秘密电视剧| 毒医肥尸1999未删减版| 白化农场| 《旷野之物》朴智炫| 西夏狼王| 大上海电影免费高清在线观看| 守护者们电视剧免费观看| 大神同学想被吃掉未增删有翻译 | 无处藏身全集电视剧免费观看| 战狼6欧美版免费观看完整版国语下载 | 光荣大地电视剧全集在线观看| 男与女电影| 冰封世界电影完整版| 纵有疾风起免费观看全集| 电影《你的导师》免费观看| xxxnxgx| 兽皇村上沙正版电影免费观看| 怒海孤鸿| 乐高幻影忍者乐高| 木下凛凛子免费观看| 舒淇的全部三电影| 品味人生在线观看免费高清电视剧坎| 乱世丽人行 电视剧| 舞乐传奇| 百万遗产 韩剧全集| 我的三体| 美乃雀免费看| 灵与欲百度影音| 新金银屏1-5美国普通话| 《超时空辉夜姬!》| 完美婚姻的定式首播| 我就是这般女子完整版免费观看| 春家小姐是讼师 电视剧免费观看| 强奸电影下载| 杜拉拉升职记在线| 《第一次的人妻》| 温暖你点燃我电视剧免费观看| 强者风范| 做aj的电视剧大全免费观看下载| 花与罪网剧免费观看| 大连市| 郑家榆电视剧| 长扇舞欢聚一堂| 巴西按摩师无删减版在线观看百度云| 都挺好免费全集在线观看| 法医宋慈 电视剧| 嫂子的职业免费观看| 漂亮妈妈9中字开头歌曲 | 独自等待迅雷下载| 绝望写手 第五季| 恶意编年史| 斯巴达第四季无删减在线看| 三年在线观看免费完整版中文| 电影我的漂亮的瘦子3| 天价宠妻短剧全集| 快乐星球全集| 私人家教1983版电影免费观看 | 原来是老师啊动漫| 囧妈免费观看完整版| 《继牳3理伦片》在线| 蝙蝠侠与罗宾| 清徐县| 两世欢免费观看全集| 玉女心经qvod| 蘑菇一个好妈妈HD7字的答案| 广场舞社会主义好| 泉水叮咚响广场舞| 天海翼在线观看视频| 爸爸的朋友2在完整有限中字| 法国空乘2016未删减版| 碧城诀 电视剧| 冯提莫干爹| 三年大片在线观看免费观看国语完整版| 新建文件夹2线观看| 成人版巜女超人H版| 范冰冰 电影| 加里森敢死队电影| 人头肉骨茶| 普门品全文念诵及回向全文| 《初体验5》免费观看完整版| 电视剧女人香| 一生守护电视剧全集百度影音| 她被搬运工侵犯未删减版在线播放| 十月三十三日电视剧免费播放| 《王李丹妮极乐宝鉴2》| 新金瓶梅 高清下载| 电影大刀王五| 男人女人一愁愁愁电视剧在线观30集| 宁安如梦电视剧免费观看全集播出| 隋炀帝艳史电影在线播放| 怒火街头2国语版| 我和部长出差的日子在线观看免费| 加油菊花国语| 部长来我家| 南京地铁事故| 你莫走原唱| 东京塔越南女兵电影完整版| 杀手之王李连杰| 高清心不由己| 后营露宿第二季在线观看 | 玩弄三个高大的熟妇赶尸艳谈| 莉娜安德森作品在线观看完整版免费| 对不起我爱你国语版全集| 美版《荒岛女儿国》在线观看完整版| 功夫熊猫电视剧| 单数绝配| 高压监狱2高压法版| 哈儿司令| 小鸡电影网| 办公室里的滋润| 空调修理工韩国电影| 神雕无人机| 恶作剧之吻电视剧| 高清《天气之子》电影免费看| 禁忌1980满天星凯·帕克 | 特殊理发店待遇8的最新章节和内容| 功夫周星驰国语高清| 偷心俏佳人下载| 美容院| 《孤舟》电视剧| 盗亦有道百度影音| 丰满的继牳5伦A片在线| 新版马永贞电视剧| 黑帮枪战| 吴绮珊新剧《香醇秀感》在线播放 | 屠宰娃娃完整高清在线观看| 末路狂花电影在线完整观看| 《克里斯蒂娜》电影在线观看| 魔兽在线观看| 《麦乐迪·:女超人》在线观看| 南山兵哥全见版全集在线观看免费 | 挟洋自重| 《民间怪谈录》在线观看| 麦乐迪melody与父亲在线观看| 仁心俱乐部在线看| 西虹市首富第二季正片| 《天字号监狱》电影在线观看免费高清 | 特殊理发店待遇8的最新章节和内容| 韩剧《王国》| 生化危机3 灭绝| 社长夫人的美貌| 无尽之剑宝石| 李采潭的电影全集在线观看 | 邻居也风狂第1集| 彷徨之刃免费观看完整版| 美容室的待遇4中文版| 《年轻女教师3》在线| 选了戴蝴蝶面具的妈妈作者是谁| 黑白配hd1080完整版高清| 女老师电影正片| 黑白人生电视剧| 朝国年经继拇2| 美丽人生 韩剧| 情不自禁高清完整版| 将军夫人全集免费| 啄木鸟:女版《壮志凌云》电免费观看| 上瘾第二季| 人体蜈蚣2彩色| 三级推拿片| 黑白通吃:都市狂龙全集免费| 安新县| 玫瑰故事电视剧免费视频| 斗罗大陆177| 韩国r片| 我的丑娘演员表| 后宫如懿传第二部| 偶像女友| 依然闪亮未删减| 《恋爱禁区》电影| 成全动漫观看免费高清动漫| 蒋丽萍故乡情| 《朋友夫妇:交换》3| 美容院特殊职务5| 涛声依旧简谱| 青盲电视剧全集50| 82板杨敏思版本1-5电视剧免费观看就是 | 高清《摩绪》电视剧| 光荣时代| 啄木鸟:女版《壮志凌云》演员| 折腰电视剧免费全集| 电影江山美人| 强伦睡着的妺妺| 蜘蛛侠1国语版| 李云龙楚云飞扮演者再同框| 日本电影《特殊游泳课》的编剧是谁 | 狂飙免费播放| 彭丹徐锦江电影《悟间道之奇缘》 | 《逆爱》1-24集全| 傻王闯天下主题曲| 洒店实行生电影在线观看| 八戒在线观看免费高清电视剧狂飙| 装台全集电视剧免费观看| 需要爸爸的种子伦理影院| 白鹿原电视剧完整版| 《母亲》电影| 人猿泰山无删减版1995主演| 《妓院里的中国姑娘》BD高清高清在线| 泰剧金螺全集中文字在线观看| 荣誉守则在线| 守护解放西第三季在线观看| 乃木坂春香的秘密动漫| 麦乐迪女超人在线播放 | 恋爱暴君2动漫| 《交换上司的秘书2》| 爱的罗曼史无删减在线观看BD| 百分百千金| 莫丽3特别酒店完整版| 好汉秦琼| 七夜雪电视剧在线观看完整版免费 | 男人不难嫁| 蜜桃伦理| 暴躁老妈1-46集剧情| 默杀电影免费播放在线观看| 法国少女农场在线看| 《出轨的女人2》| 代号叫麻雀| 满天星安娜采访拳王泰格 | 兵团岁月电视剧| 电影《瓜达卢佩的玫瑰》在线观看 | 法国空姐6大结局| 如懿传在哪里看| 城中之城剧情介绍| 盐源县| 母亲母亲演员表| 高清两架钢琴| 保你平安 电影| 金银悔5普通话国语版免费| 仁心解码| 万古仙王200集完全版| 一个好妈妈8字头强华驿是第几集出现| 伦敦沦陷| 超神学院第三季| 高压监狱2免费满天星法版完整版2019| 制服诱惑2地下法庭| 色戒电影完整版观看免费高清| 人猿泰山未删减版1991劳拉 | 泰剧婉通夫人结局| 爱唯侦察偷拍| 侏罗纪世界3国语版免费观看| 巡回检察组43| 满天星急救护士法版2| 藏珠短剧全集免费| 法国空乘2018在线观看免费| 精灵俏女巫| 叼嗨片| 神奇宝贝bw剧场版| 电影《玛丽玛丽》| 台剧浪漫女家教免费观看第11集| 家庭教师h的偏差值| 维生素爱香水| 朝国年经继2| 我的罪恶人生在线观看| 敢死队高清| 禁野2年后的华农兄弟:主业变养羊| 《玉女心经3之阴阳和合》免费舒淇 | 黛比浪漫女教师BD播放| 密战电视剧在线播放| 洗屋先生我和| 酒店1-5集在线观看免费版下载| 时尚王国电视剧| 《热带雨》未测减除版| 《年轻女教师3》韩国| 《隔山有眼3:起源》免费下载| 恶搞之家无删减在线观看| 全球热恋粤语QVOD| 特殊保险推销员8| 吸血鬼日记第四季快播| 超级接班人| 苏州市| 《性的暴行》无删减版电影 | 重振精武门| 哆啦a梦国语版高清在线观看| 爱可以重来电视剧全集| 加勒比女海盗在线| 西出玉门电视剧免费看| 电视剧《福贵》在线观看| 台湾《小凤新婚下》演员表| 聊斋艳谈百度影音| 传说中的七公主全集| 北方影院迷宅幻影| 美乃雀赎罪电影哪里看| 新乌托邦在线观看完整版电影| 飞驰人生1免费观看全集| 朝国年经的继2免费观看时间| 向往的生活第六季免费看| 超凡蜘蛛侠3在线观看完整免费版| 变种女狼3归来| 小辣椒3电影免费播放| 电视剧生死相依| 小奥尼尔厉害吗| 隆昌县| 骄阳伴我免费观看全集| 斗罗大陆免费全集| 致命的一击36集电视剧在线观看| 漂亮小瘦子| 极品女士第三季| 刀郎新歌翩翩| 高清《浮图缘》免费观看全集完整版| 去上司家拜访电影免费观看| 血色玫瑰2| 三客电影| 暴躁少女的视频全集泰国版 | 新闻联播回放今天| 电影聊斋兰若寺免费观看| 妹妹最近有点怪真人电影原声 | 亢奋第二季第七集| 只要为你活一天电影| 木子檀电影免费观看2023| 牙医姐妹完整版免费观看高清| 冬至电视剧全集免费观看完整版高清| 黄子华栋笃笑2018| 木下凛凛子伦理电影| 千年血战篇第二季在线观看| 终极快递国语| 芳华解说| 东北抗联电视剧| 莫妮卡爱我几何在线看| free第二季在线观看完整版| qingchunqi| 青山是故乡| 四名少妇按摩记电影| 钱塘传奇电视剧| 熊出没·重启未来电影| 食物链2电影免费观看全集高清| 来玩吧120709中字| 聊斋画皮全集| 安赛龙 中文| 韩国三级《下属的妻子| 高清《奔跑吧第5季》综艺| scp电影| 82板杨敏思版本1-5电视剧在线观看 | 美国电影《飘》免费观看中文| 荒野渔夫| 和空姐一起的日子剧情| 台风烟花已上岸 即将登陆| 爱上女学生电影完整版| 侄女开发日记1-6季| 回到野人身边| 点燃我温暖你更新时间| 兽皇村上沙正版电影免费观看| 白夜破晓| 天海翼电影全集| 城中之城电视剧免费观看全集剧情| 生死决断秋瓷炫几分出场| 伪娘刘著| 爱的勘探法电视剧| 暗恋成真:男神爱上我短剧全集| 军事不当啄木鸟满天星法版| 《苍蓝战士奥特曼》免费观看| 那金花和她的女婿电视剧免费观看| 终末的女武神在哪个APP可以看| 微电影妈妈的职业| 姐姐6免费完整高清电视剧| 那山那人那狗电影| 我的父亲母亲的婚姻 电视剧| 迷宫HD版| 凹凸世界第四季免费观看| 《暮光之城4:破晓(下)》| 亲吻姐姐02| 蛇姬恋泰剧未删减版本| 我被在教室强了好爽在线观看 | 朋友换麦子3和电影有关系吗| 天罚电视剧在线观看完整版| 乐高蜘蛛侠拼装教程| 和政县| 白峰美羽在线观看视频中文字幕| 高清《美景之屋1》| 泽塔奥特曼第十集| 湟中县| 台湾版《棘手狂情》电影在线免费观看 | 需要爸爸播种免费看中文版 | 天衣无缝的她| 牵牛的夏天片尾曲| 电视剧母子情仇| 女律师的坠落未删减版观看| 辣椒教室片尾曲| 美女化妆前后对比| 让子弹飞国语版字幕1080p| 私人航空免费在线观看完整版| 小城大事电视剧在线观看免费| 爸爸当家第三季免费观看完整版高清| 女生拒买47元水果捞被骂小三| 电影美容院的待遇5| 窃欲无罪完整版电影免费播放| 帽子的编织方法| 欧美成人版电影荣誉守则在线免费观看| 大男当婚全集免费观看| 陶笛天空之城| 民初奇人传全集免费观看| 做aj的电视剧|