本发明公开了一种基于多智能体强化学习的效用感知的协作服务缓存方法,本发明为了实现边缘计算环境中最小化应用服务供应商成本,并最大限度地减少服务延迟,首先将协作式服务缓存问题建模成一个多智能体联合多臂老虎机模型,之后提出了一个基于多智能体强化学习的效用感知的协作服务缓存方案。该方案能协调多个边缘服务器做出动态的联合缓存决策,目的是使整个系统的长期效用最大化。最后,将本发明提出的策略与其他策略在不同实验参数下进行对比,证明了本发明的有效性。
📄 2021112986488
📂 H04L67_568
👤 杭州电子科技大学
📅 2021-11-04
本发明属于信息技术领域,公开了一种面向MADDPG多智能体强化学习模型的可视分析方法,包括如下步骤:步骤1:选取一款合作类游戏作为MADDPG模型的运行环境,并定义相关的参数集合;步骤2:训练MADDPG模型,保存并计算重要的中间数据;步骤3:设计标签板,标识智能体和地标;步骤4:设计统计视图;步骤5:设计评论家行为视图,用于评估模型学习得到的评论家的性能;步骤6:设计交互视图。本发明提出了一种新的可视分析方法,能支持交互式地分析合作类环境中MADDPG模型的工作流程和内部原理。该发明设计了多个协同的视图,从不同角度揭示MADDPG模型的内部执行机制。
📄 2021105049705
📂 G06F16_28
👤 杭州电子科技大学
📅 2021-05-10
本发明公开了一种基于多智能体强化学习的水下无线传感器网络路由方法,属于水下无线传感器网络路由技术领域。本发明首先将水下环境中的每个传感器节点看作单独的智能体,使其与环境信息进行交互,根据环境交互信息设计全局奖励函数和局部奖励函数,还提出了一种考虑地理位置信息的Q值初始化方法。然后通过分布式值函数计算并更新节点的Q值,当源节点在本地缓存足够的数据包时,根据Q值来选择下一跳路由。最后为防止数据转发过程中的冲突,给出了最优路由数据保持时间的计算函数,并设计了路由转发数据包的格式。本发明能够有效确定水下无线传感器网络数据转发的最优路径,减少网络中的数据冲突,提高水下无线传感器网络中的路由效率。
📄 202310159756X
📂 H04W40_04
👤 青岛科技大学
📅 2023-02-24
本发明公开了一种基于集成的合作多智能体深度强化学习方法,包括如下步骤:步骤1、演员评论家网络或者动作值网络的初始化;步骤2、获取局部观察;步骤3、合作多智能体系统在环境中的决策;步骤4、抽取转移样本;步骤5、训练演员评论家网络或者动作值网络;步骤6、重复步骤2‑5,直至训练结束。这种方法为每个智能体集成多个策略网络或者动作值网络,使得智能体依据能多个策略网络或者动作值网络集成的输出进行决策,以提升智能体决策的鲁棒性。该方法为集成的多个策略网络或者动作值网络使用不同的样本训练进行训练,保证了它们的多样性。有效提升智能体决策的鲁棒性,同时还具有良好的适用性。
📄 2023104534632
📂 G06N3_092
👤 桂林电子科技大学
📅 2023-04-25
本发明公开了一种基于多智能体强化学习的分布式WSN能量效率路由优化方法,分布式地在每个传感器节点部署具有决策模块的智能体,构建路由协作决策系统,所有智能体采用同步决策的方式,每个智能体的决策模块周期性地根据本地观察值向量和位置向量在本地计算得路由策略向量;决策模块采用多智能体强化学习算法进行训练,然后对无线传感网络进行部署,部署完成后周期性地采用路由协作决策系统更新路由方案。本发明综合考虑能量消耗和能量均衡性,以完全分布式的方式实现数据包的无环转发路径联合规划,提高网络存活时间。
📄 2023107627501
📂 H04W40_04
👤 电子科技大学广东电子信息工程研究院
📅 2023-06-26
本发明公开了一种基于多智能体强化学习的多数据中心协同节能方法,根据每个数据中心的机柜出风口温度和机柜的负载,对每个数据中心中的IT系统单元、冷却系统单元分别建模得到IT负载模型和热模型;根据多数据中心混合系统在云端执行任务时的时延建立传输时延模型,结合得到的IT负载模型和热模型,得到目标函数;根据单数据中心IT‑冷却系统的状态空间和任务调度的行动空间,结合所述目标函数,构建参数化多智能体深度强化学习模型;利用参数化多智能体深度强化学习模型训练AI引擎;对每个数据中心,将采集到的实时数据中心状态信息输入到训练好的AI引擎中,输出单数据中心IT‑冷却系统的最优控制策略。
📄 2021103332371
📂 G06F1_3234
👤 重庆邮电大学
📅 2021-03-29