5、MC ε-Greedy algorithm案例5.1 MC ε-Greedy algorithm的探索性现在,我们分析该算法的探索能力,一个单独的episode可以visit所有的state-action pairs吗?当 ε = 1 时,策略(均匀分布)具有最强的探索能力。可以看到,随着步数的增加,网格中几乎所有的位置都探索到了(绿色线),每个state-action被访问的次数也比较高。那自然我就不再需要用exploring starts这样一个条件了,我不需要从每一个