摘要
本发明公开了一种基于双经验池DQN的交通信号灯控制方法,包括:1、建立基于DQN算法的交通信号灯控制主网络和目标值网络;2、初始化算法相关参数,采集交通路口的路况信息,建立状态值st;3、将st输入主网络中,选择Q值最大值的动作at;4、执行at并计算奖励rt和状态st+1;将(st,at,rt,st+1)存储到第一经验池;5、如果奖励rt大于历史经验平均奖励将(st,at,rt,st+1)存储到第二经验池;6、生成随机数P,以概率1‑P选择第一经验池,以概率P选择第二经验池,在选中的经验池中随机抽样,通过最小化损失函数训练主网络的参数;S7、定时更新目标值网络的参数;根据当前路况信息更新st,跳转至步骤3继续执行。该方法能够使算法快速收敛,获得的交通信号灯控制策略快速优化。