☰
RL-05-赵-不基于模型1:MC算法06【MC ε-Greedy例子】【当ε=1时,策略(均匀分布)具有最强的探索能力,牺牲了最优性】【当ε=0就退化为Greedy Algorithm】
2026/9/29 4:32:11 网站建设 项目流程

5、MC ε-Greedy algorithm案例

5.1 MC ε-Greedy algorithm的探索性


现在,我们分析该算法的探索能力,一个单独的episode可以visit所有的state-action pairs吗?

  • 当 ε = 1 时,策略(均匀分布)具有最强的探索能力。

    可以看到,随着步数的增加,网格中几乎所有的位置都探索到了(绿色线),每个state-action被访问的次数也比较高。那自然我就不再需要用exploring starts这样一个条件了,我不需要从每一个

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询