{"type":"product","schema_version":"1.0","item_id":"100627205569","canonical_url":"https://tw.bid.yahoo.com/item/100627205569","title":"益大資訊~用 Python 實作強化學習｜使用 TensorFlow 與 OpenAI Gym 978986502141","subtitle":null,"condition":"全新品","currency":"TWD","observed_at":"2026-08-23T07:54:51.591Z","current_price":390,"original_price":"520.00","stock_status":"in_stock","available_quantity":5,"sold_quantity":0,"seller":{"id":"Y1221244390","name":"益大資訊電腦圖書專賣店","positive_rate":null,"rating_count":null},"images":[{"url":"https://img.yec.tw/ob/image/3e8fe328-ce7d-4cd6-bce9-cb5a9a1b7c04.jpg","role":"main","alt":"商品主圖","width":null,"height":null}],"description":"益大資訊~用 Python 實作強化學習｜使用 TensorFlow 與 OpenAI Gym 978986502141出版社:碁峰\n\n出版日期:2019年5月29日\n\nISBN:9789865021412\n\n書號:ACD017800\n\n定價:520元     售價:390元\n\n內容簡介\n\n強化學習可說是能自我演進的機器學習，能帶領我們達到真正的人工智慧。本書好讀又容易上手，運用了大量Python範例來從頭解釋所有東西。本書從強化學習的簡介開始，接著是OpenAI Gym與TensorFlow。您會認識各種RL演算法與重要觀念，例如Markov決策過程、蒙地卡羅法與動態規劃，包括價值迭代與策略迭代。本書提供了非常豐富的範例幫助您認識各種深度強化學習演算法，例如競爭DQN、DRQN、A3C、PPO與TRPO。您還會學到想像增強代理、透過人類偏好來學習、DQfD、HER以及更多強化學習的最新發展。本書精彩內容：．理解強化學習方法、演算法與重要元素的相關基礎．使用OpenAI Gym與TensorFlow來訓練代理．理解Markov決策過程、Bellman最佳化與TD學習．運用多種演算法來解決多臂式吃角子老虎問題．熟悉各種深度學習演算法，如RNN、LSTM、CNN與其應用．使用DRQN演算法來建置智能代理來玩毀滅戰士遊戲．使用DDPG來教導代理來玩月球冒險遊戲．使用競爭DQN來訓練代理來玩賽車遊戲\n\n \n\n第一章｜認識強化學習\n介紹何謂強化學習以及其運作原理。介紹強化學習的各種元素，如代理、環境、策略與模型，並帶領讀者認識用於強化學習的各種環境、平台與函式庫，以及強化學習的一些應用。\n\n \n\n第二章｜認識OpenAI與TensorFlow\n建置使用強化學習的電腦環境，包括Anaconda、Docker、OpenAI Gym、Universe與TensorFlow的安裝設定，並說明如何在OpenAI Gym中來模擬代理，以及如何建置一個會玩電玩遊戲的機器人程式。另外也會解說TensorFlow的基礎觀念以及如何使用TensorBoard來進行視覺化操作。\n\n \n\n第三章｜Markov決策過程與動態規劃\n從介紹何謂Markov鍊與Markov流程開始，說明如何使用Markov決策流程來對強化學習問題來建模。接著是一些重要的基本概念，例如價值函數、Q函數與Bellman方程式。然後介紹動態規劃以及如何運用價值迭代與策略迭代來解決凍湖問題。\n\n \n\n第四章｜使用Monte Carlo方法來玩遊戲\n介紹了Monte Carlo法與不同類型的 Monte Carlo預測法，如首次拜訪MC與每次拜訪MC，並說明如何使用Monte Carlo法來玩二十一點這項撲克牌遊戲。最後會介紹現時與離線這兩種不同的Monte Carlo控制方法。\n\n \n\n第五章｜時間差分學習\n介紹時間差分（TD）學習、TD預測與TD的即時/離線控制法，如Q學習與SARSA。並說明如何使用Q學習與SARSA來解決計程車載客問題。\n\n \n\n第六章｜多臂式吃角子老虎機問題\n要討論的是強化學習的經典問題：多臂式吃角子老虎機（MAB）問題，也稱為k臂式吃角子老虎機（MAB）問題。介紹如何使用各種探索策略來解決這個問題，例如epsilon-貪婪、softmax探索、UCB與湯普森取樣。本章後半也會介紹如何運用MAB來對使用者顯示正確的廣告橫幅。\n\n \n\n第七章｜深度學習的基礎概念\n介紹深度學習的重要觀念。首先，說明何謂神經網路，接著是不同類型的神經網路，如RNN、LSTM與CNN等。本章將實作如何自動產生歌詞與分類時尚產品。\n\n \n\n第八章｜使用深度Q網路來玩Atari遊戲\n介紹了一套最常用的深度強化學習演算法：深度Q網路（DQN）。接著介紹DQN的各個元件，並說明如何運用DQN來建置代理來玩Atari遊戲。最後介紹一些新型的DQN架構，如雙層DQN與競爭DQN。\n\n \n\n第九章｜使用深度循環Q網路來玩毀滅戰士\n介紹深度循環Q網路（DRQN），並說明它與DQN的差異。本章會運用DRQN來建置代理來玩毀滅戰士遊戲。同時介紹深度專注循環Q網路，它在DRQN架構中加入了專注機制。\n\n \n\n第十章｜非同步優勢動作評價網路\n介紹了非同步優勢動作評價網路（A3C）的運作原理。我們將帶領你深入了解A3C的架構並學會如何用它來建置會爬山的代理。\n\n \n\n第十一章｜策略梯度與最佳化\n說明策略梯度如何在不需要Q函數的前提下，幫助我們找到正確的策略。同時還會介紹深度確定性策略梯度法，以及最新的策略最佳化方法，如信賴域策略最佳化與近端策略最佳化。\n\n \n\n第十二章 使用DQN來玩賽車遊戲\n本章將帶領你運用競爭DQN來建置代理，讓它學會玩賽車遊戲。\n\n \n\n第十三章 近期發展與下一步\n介紹強化學習領域中的各種最新...","shipping_methods":[{"name":"7-ELEVEN取貨付款","fee":0,"currency":"TWD"},{"name":"郵局掛號","fee":0,"currency":"TWD"}],"lowest_shipping_fee":null,"payment_methods":["ATM轉帳","7-ELEVEN取貨付款"],"category_id":"2092073795","category_name":"程式語言","breadcrumb":[{"id":"3994318","name":"圖書/影音/文具","url":"/tw/%E5%9C%96%E6%9B%B8-%E5%BD%B1%E9%9F%B3-%E6%96%87%E5%85%B7-3994318-category.html"},{"id":"2092064185","name":"圖書與雜誌","url":"/tw/%E5%9C%96%E6%9B%B8%E8%88%87%E9%9B%9C%E8%AA%8C-2092064185-category.html"},{"id":"2092073792","name":"電腦/網路","url":"/tw/%E9%9B%BB%E8%85%A6-%E7%B6%B2%E8%B7%AF-2092073792-category.html"},{"id":"2092073795","name":"程式語言","url":"/tw/%E7%A8%8B%E5%BC%8F%E8%AA%9E%E8%A8%80-2092073795-category.html"}],"view_count":0,"watch_count":1}