- 电子工业出版社
- 9787121295164
- 1-15
- 293565
- 48252974-0
- 平塑勒
- 16开
- 2024-04
- 705
- 548
- 工学
- 计算机科学与技术
- 计算机科学与技术
- 本科 研究生及以上
作者简介
目录
目录__eol__第1 章导论· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 1__eol__1.1 强化学习· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 1__eol__1.2 示例· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 4__eol__1.3 强化学习要素· · · · · · · · · · · · · · · · · · · · · · · · · · · · 5__eol__1.4 局限性与适用范围· · · · · · · · · · · · · · · · · · · · · · · · · · 7__eol__1.5 扩展实例:井字棋· · · · · · · · · · · · · · · · · · · · · · · · · · 8__eol__1.6 本章小结· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 12__eol__1.7 强化学习的早期历史· · · · · · · · · · · · · · · · · · · · · · · · · 13__eol__第I 部分表格型求解方法· · · · · · · · · · · · · · · · · · · · · · · · · · · 23__eol__第2 章多臂赌博机· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 25__eol__2.1 一个k 臂赌博机问题· · · · · · · · · · · · · · · · · · · · · · · · 25__eol__2.2 动作-价值方法· · · · · · · · · · · · · · · · · · · · · · · · · · · · 27__eol__2.3 10 臂测试平台· · · · · · · · · · · · · · · · · · · · · · · · · · · · 28__eol__2.4 增量式实现· · · · · · · · · · · · · · · · · · · · · · · · · · · · · 30__eol__2.5 跟踪一个非平稳问题· · · · · · · · · · · · · · · · · · · · · · · · · 32__eol__2.6 乐观初始值· · · · · · · · · · · · · · · · · · · · · · · · · · · · · 34__eol__2.7 基于置信度上界的动作选择· · · · · · · · · · · · · · · · · · · · · 35__eol__2.8 梯度赌博机算法· · · · · · · · · · · · · · · · · · · · · · · · · · · 37__eol__2.9 关联搜索(上下文相关的赌博机) · · · · · · · · · · · · · · · · · · 40__eol__2.10 本章小结· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 41__eol__强化学习(第2 版)__eol__第3 章有限马尔可夫决策过程· · · · · · · · · · · · · · · · · · · · · · · · 45__eol__3.1 “智能体-环境”交互接口· · · · · · · · · · · · · · · · · · · · · · 45__eol__3.2 目标和收益· · · · · · · · · · · · · · · · · · · · · · · · · · · · · 51__eol__3.3 回报和分幕· · · · · · · · · · · · · · · · · · · · · · · · · · · · · 52__eol__3.4 分幕式和持续性任务的统一表示法· · · · · · · · · · · · · · · · · 54__eol__3.5 策略和价值函数· · · · · · · · · · · · · · · · · · · · · · · · · · · 55__eol__3.6 最优策略和最优价值函数· · · · · · · · · · · · · · · · · · · · · · 60__eol__3.7 最优性和近似算法· · · · · · · · · · · · · · · · · · · · · · · · · · 65__eol__3.8 本章小结· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 66__eol__第4 章动态规划· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 71__eol__4.1 策略评估(预测) · · · · · · · · · · · · · · · · · · · · · · · · · · 72__eol__4.2 策略改进· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 75__eol__4.3 策略迭代· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 78__eol__4.4 价值迭代· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 80__eol__4.5 异步动态规划· · · · · · · · · · · · · · · · · · · · · · · · · · · · 83__eol__4.6 广义策略迭代· · · · · · · · · · · · · · · · · · · · · · · · · · · · 84__eol__4.7 动态规划的效率· · · · · · · · · · · · · · · · · · · · · · · · · · · 85__eol__4.8 本章小结· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 86__eol__第5 章蒙特卡洛方法· · · · · · · · · · · · · · · · · · · · · · · · · · · · · 89__eol__5.1 蒙特卡洛预测· · · · · · · · · · · · · · · · · · · · · · · · · · · · 90__eol__5.2 动作价值的蒙特卡洛估计· · · · · · · · · · · · · · · · · · · · · · 94__eol__5.3 蒙特卡洛控制· · · · · · · · · · · · · · · · · · · · · · · · · · · · 95__eol__5.4 没有试探性出发假设的蒙特卡洛控制· · · · · · · · · · · · · · · · 98__eol__5.5 基于重要度采样的离轨策略· · · · · · · · · · · · · · · · · · · · · 101__eol__5.6 增量式实现· · · · · · · · · · · · · · · · · · · · · · · · · · · · · 107__eol__5.7 离轨策略蒙特卡洛控制· · · · · · · · · · · · · · · · · · · · · · · 108__eol__5.8 ? 折扣敏感的重要度采样· · · · · · · · · · · · · · · · · · · · · · 110__eol__5.9 ? 每次决策型重要度采样· · · · · · · · · · · · · · · · · · · · · · 112__eol__5.10 本章小结· · · · · · · · · · · · · · · · · · · · · · · · · · · · · · 113__eol__第6 章时序差分学习· · · · · · · · · · · · · · · · · · · · · · · · · · · · · 117__eol__6.1 时序差分预测· · · · · · · · · · · · · · · · · · · · · · · · · · · · 117__eol__6.2 时序差分预测方法的优势· · · · · · · · · · · · · · · · · · · · · · 122__eol__6.3 TD(0) 的最优性· · · · · · · · · · · · · · · · · · · · · · · · · · · 124__eol__6.4 Sarsa:同轨策略下的时序差分控制· · · · · · · · · ·