ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

强化学习基础知识

强化学习基础知识 目录1. 强化学习基本概念1.1 Agent1.2 Environment1.3 State1.4 Action1.5 Reward2. 强化学习的随机性来源2.1 Policy2.2 State transition3. 回报与价值函数3.1 Returnaka cumulative future reward)3.1.1 Return未来累计奖励3.1.2 Discounted Return折扣回报3.2 Action-value function3.3 State-value function4. 强化学习目标4.1 policy-based learning4.2 value-based learning1. 强化学习基本概念1.1 Agent执行动作、和环境交互的主体。1.2 EnvironmentAgent外部世界接收动作返回新状态与奖励。1.3 State环境当前观测到的信息。1.4 ActionAgent在状态下做出的动作。1.5 Reward环境给予的反馈。2. 强化学习的随机性来源2.1 Policy策略函数给定状态计算动作的概率根据概率随机抽样使Agent做动作。具体来说就是根据观测到的状态做出决策来控制Agent运动。2.2 State transition环境用状态转移函数算出概率根据概率随机抽样得到下一个状态。3. 回报与价值函数3.1 Returnaka cumulative future reward)3.1.1 Return未来累计奖励t 时刻的回报从 t 时刻的奖励开始一直加到结束。t 时刻我们更关注的是此刻的奖励因此 t 时刻以后的奖励的权重应降低由此引出Discounted Return。3.1.2 Discounted Return折扣回报t 时刻的折扣回报折扣率超参数人工手动调若未来的奖励和此刻的奖励同样重要则若未来的奖励不重要则可以小些。3.2 Action-value function是随机变量依赖于未来的所有动作以及未来的所有状态只与当前的状态和动作以及policy函数有关。具体来说已知policy函数给当前状态下所有的动作打分从而得知动作的好坏3.3 State-value function对关于动作求期望把消掉得到的只与和状态有关。4. 强化学习目标强化学习的目标就是学习到policy函数或最优动作价值函数去控制Agent让Agent基于当前的状态来做出相应的动作争取在未来得到尽量多的奖励。4.1 policy-based learning策略学习利用policy函数根据状态计算动作的概率根据概率随机抽样使Agent做动作。观测到一个状态把作为policy函数的输入,函数输出每一个动作的概率根据概率随机抽样得到动作Agent执行动作。4.2 value-based learning价值学习利用最优动作价值函数函数根据状态计算根据使Agent做动作。观测到一个状态把作为的输入,函数每一个动作做评价得到每一个动作的值选择让最大化的动作作为下一个动作Agent执行动作。
返回列表