登录社区云,与社区用户共同成长
邀请您加入社区
王树森深度强化学习基础:价值学习
DQN 是一个价值学习的方法,用一个神经网络去近似Q*函数。DQN 的输入是s,w为神经网络的参数,输出是对每一个动作a的打分。怎么训练DQN呢? 最常用的是TD算法。
TD算法即使不完成旅程,也能更新参数。
更多推荐
阿里云 Coding Plan Lite 下架,各家算力吃紧,上哪买还能支持GLM-5和5.1的coding plan?_2026-04-15
看遍了市面上的coding plan,我发现还是这个好用
好家伙,这有一个Notebook LM 的“野生 API“,可以用Claude Code免费用 Google 大模型
扫一扫分享内容
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
所有评论(0)