☰
【无标题】RL-赵-(八)-ValueBased04-ActionValue估算:Deep Q-learning02(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】
2026/9/26 3:34:21 网站建设 项目流程

RL-赵-(八)-Value-Based04:Deep Q-learning(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】【目标:最优化网络参数⮕使得通过网络计算出的q是最优的】

1、技巧01:Two Networks(两个网络)

第一个技巧: 使用了两个网络,一个是main network, 另一个是target network。为什么要使用两个网络呢? 在数学上来说因为计算梯度的时候会非常的复杂,所以先去固定一个,然后再去计算另一个,这样就需要两个网络来实现。

具体实现的细节:

  • 令w ww和w T w_TwT​分别表示mean network和target network的参数,它们初始化的时候是一样的。
  • 在每个iteration中,从 replay buffer【这里边包含了很多的experience的sample】 中 draw —个 mini-batch 样本{ ( s , a , r , s ′ ) } \{(s,a,r,s^{\prime})\}{(s,a,r,s′)}
  • 网络的输入包括 states ss和 actiona aa, 输出y = q ^ ( s , a , w ) y = \hat{q}(s, a, w)y=q^​(s,a,w)。y ^ \hat{y}y^​的目标值是y T ≐ r + γ max ⁡ a ∈ A ( s ′ ) q ^ ( s ′ , a , w T ) y_T\doteq r+\gamma\max_{a\in\mathcal{A}(s^{\prime})}\hat{q}(s^{\prime},a,w_T)yT​≐r+γmaxa∈A(s′)​q^​(s′,a,wT​)。然后为了更新Main Network 我们直接基于the mini-batch

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询