摘要
本发明请求保护一种基于深度强化学习的四旋翼无人机悬停控制方法,包括以下步骤:①初始化动作网络、动作标签网络、价值网络、价值标签网络和经验回放池。②根据当前环境和无人机状态,将状态向量作为动作神经网络输入层,将动作向量作为动作神经网络输出层。③无人机根据动作选择策略生成动作并作用于仿真环境。④仿真环境反馈即时奖励以及环境和无人机下一状态并将经验存入经验回放池。⑤从经验回放池提取经验并周期性更新动作标签网络和价值标签网络参数供动作网络和价值网络学习。本发明采用新探索利用机制和实时折扣率后,无人机训练速度相对于之前提前了200个时间步。