... delayed response learning 延迟反应学习 delayed reward 延宕奖赏 delayed sensation 延缓感觉 ...
基于60个网页-相关网页
反复实验搜索(trial-and-error search)和延迟回报(delayed reward)是强化学习的两个主要特 征 [2] 。Q-学习是一种典型的强化学习算法 [3] 。
基于8个网页-相关网页
reward delayed 迟来的嘉奖
Delayed reward may be expected from news of public affairs, economic matters, social problems, science, education, and health.
而延迟回报则往往和公众事件、经济、社会问题、科学、教育以及健康等方面的行为有关。
Participants were asked to make eight choices; each was between receiving a small, but immediate, reward and a larger, but delayed, reward.
参与者被要求作出八项选择,每一项都是在得到一个小的但即时的奖励和一个更大的但延时的奖励之间。
应用推荐