ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RL-赵-(七)-不基于模型2-时序差分/TD算法05-计算ActionValue:Q-Learning05【Q-learning案例】

RL-赵-(七)-不基于模型2-时序差分/TD算法05-计算ActionValue:Q-Learning05【Q-learning案例】 三、Q-learning案例任务描述: 在网格世界中,找到所有states的一个最优策略。任务设定:rtarget=1,rforbidden=rboundary=−1r_{target}=1,r_{forbidden}=r_{boundary}=-1rtarget​=1,
返回列表