强化学习——Q-Learning寻找宝藏

主要公式算法: T代表宝藏,o代表移动步数去寻找,通过强化学习训练,会寻找得越来越快,步数越来越少 到第六步之后学会了直接直奔宝藏! import numpy

主要公式算法:

T代表宝藏,o代表移动步数去寻找,通过强化学习训练,会寻找得越来越快,步数越来越少

到第六步之后学会了直接直奔宝藏!

import numpy as np
import pandas as pd
import timenp.random.seed(2)N_STATES = 6 # 一维世界的长度
ACTIONS = ['left','right'] # 探索者可选择的动作
EPSIONS = 0.9 # greedy police贪婪度
ALPHA = 0.1 # 学习效率
LAMBDA = 0.9 # 未来奖励的衰减值
MAX_EPISODES = 13 # 最大的回合数
FRESH_TIME = 0.01 # 走一步所花费的时间,移动时间间隔def build_q_table(n_states, actions):table = pd.DataFrame(np.zeros((n_states,len(actions))),  # q_table initial values全零初始化columns=actions,    # actions