下一节:
5.15 MCTS与Planning路线:从Dyna-Q到AlphaGo、AlphaZero、MuZero
重点分析:
- 为什么Model-Based RL存在两条路线:
- Dreamer路线(学习Policy)
- MuZero路线(搜索Planning)
- MCTS数学原理;
- AlphaGo如何结合深度网络;
- AlphaZero如何去掉人类棋谱;
- MuZero如何在未知环境中学习模型;
- MuZero与Dreamer本质区别。
继续
5.15 MCTS与Planning路线:从Dyna-Q到AlphaGo、AlphaZero、MuZero
上一节分析了:
Dreamer→DreamerV3→DayDreamer Dreamer \rightarrow DreamerV3 \rightarrow DayDreamer