DQN为什么离不开经验回放:一次小实验把两个经典组件拆开了

深度Q网络(DQN)能让机器在雅达利游戏里学会拿分。它的底子是 Q 学习,再加一张神经网络。

深度Q网络的基本结构图

深度Q网络的基本结构:智能体看环境状态,网络给出每个动作的价值,挑一个执行,环境返回奖励。

常见的技术介绍里,经验回放缓冲区和目标网络总是被摆在一起。两根支柱,缺一不可,这是标准说法。

对做AI工具和自建[……]

继续阅读