一种基于课程深度强化学习的多机器人路径规划方法,利用课程学习的思想,设计课程学习的各个阶段,通过改变各阶段机器人数量,以及地图大小和障碍物数量,实现任务的由易到难;搭建强化学习环境,定义环境中机器人的观察空间、动作空间以及环境的奖励函数,制定机器人在环境中的运行规则;设计一种网络结构以适应环境中变化的机器人数量,运用Qatten算法训练网络模型,本发明能解决连续空间中的多机器人路径规划问题,其优势在于能够相对传统算法更快更好的实现路径规划,提高路径规划的效率。
📄 2024117371430
📂 G01C21_34
👤 浙江工业大学
📅 2024-11-29
本发明涉及一种基于多策略深度强化学习的云制造服务组合方法,该方法结合基本DQN算法、竞争结构、双估计器和优先回放机制,同时还在模型中加入了一些策略,如奖励策略,ε‑greedy策略和启发式策略,来提高算法的性能。启发式策略可以屏蔽不可用服务,克服了由于超参数和奖励设计不合理导致DLR无法恢复到稳定状态的缺点。奖励可以让DLR可以根据真实奖励值来有效调整参数,ε‑greedy策略使算法有机会跳出局部最优。实验表明该模型不仅具有对动态环境适应性强的优点,而且比其他深度强化学习方法更好。
📄 2021115898135
📂 G06Q50_04
👤 重庆大学
📅 2021-12-23
本发明公开了基于深度强化学习的芯片全局自动布局方法,可对超大规模集成电路芯片快速布局,能够保证布局结果收敛以实现快速布局,并使得布局布线的线长、拥塞、面积达到近似最优。另外,芯片全局自动布局方法中提出一种空间利用率的方法,并将该空间利用率的方法应用在局部布局和全局自动布局中,从而使得局部布局和全局自动布局的面积达到最小。还有的是,应用异步训练网络结构,通过该网络结构学习训练,可使局部布局和全局自动布局相关性更紧密,且布局结果更容易收敛,能实现芯片全局自动布局的可靠性。
📄 2022107186260
📂 G06F30_398
👤 广东工业大学
📅 2022-06-23
本发明公开了基于深度强化学习与动态运动基元的机械臂自主抓取方法,包括如下步骤:步骤1:安装摄像机图组件,确保识别区域不被遮挡,并对抓取目标区域图像进行预处理,并作为状态信息发送给深度强化学习智能体;步骤2:基于所述状态和深度强化学习原理构建局部策略近端优化训练模型;步骤3:融合动态运动基元和模仿学习构建一种新的混合运动基元模型;步骤4:基于所述的模型训练机械臂自主抓取物体。本发明能够有效解决基于传统深度强化学习的机械臂关节运动不平滑问题,通过结合动态运动基元算法,把元参数的学习问题转化为强化学习问题,可以利用深度强化学习的训练方法使得机械臂完成自主抓取任务。
📄 2020103237211
📂 B25J9_16
👤 南通大学
📅 2020-04-22