1. 首页
  2. 区块链
  3. 比特币
  4. 2020年研究生华为杯数学建模竞赛C题.rar

2020年研究生华为杯数学建模竞赛C题.rar

上传者: 2020-10-17 03:47:36上传 RAR文件 91.42MB 热度 90次
那我们讲一下它的 algorithm。假设我们 learn 了一个 Q-function,Q-function 就是 input s 跟 a,output 就是 Q^{\pi}(s,a)Q π (s,a)。那接下来,我们要 learn 一个 actor,这个 actor 的工作就是解这个 arg max 的 problem。这个 actor 的工作就是 input 一个 state s,希望可以 output 一个 action a。这个 action a 被丢到 Q-function 以后,它可以让 Q^{\pi}(s,a)Q π (s,a) 的值越大越好。那实际上在 train 的
下载地址
用户评论