本发明公开一种基于深度强化学习的多智能体自主决策方法,应用于多智能体深度强化学习技术领域,针对现有技术在决策过程中未能充分地使用经验数据的问题;本发明通过收集智能体与环境交互生成的经验,以及奖励重塑模块优化环境即时奖励,缓存于本地经验回放池中;然后合并本地经验回放池中的历史经验数据到全局经验回放池PT‑Buffer中,并使用二级优先经验队列进行维护;通过概率求和树从PT‑Buffer采集训练样本数据,来求解目标策略网络和全局Critic网络模型;最后采用更新后的自主决策模型,根据输入的环境局部观测信息直接实现多智能体的自主决策,从而完成相关的多智能体任务。
📄 2023110158152
📂 G06N3_092
👤 电子科技大学长三角研究院(衢州)
📅 2023-08-11
本发明公开了一种面向深度强化学习的策略异常检测方法和装置,包括:利用采集的状态样本对DDPG网络进行强化学习;构建包含行动者网络和判别器的模仿学习网络,利用采集的状态样本和专家状态动作对对模仿学习网络进行训练;利用参数优化的DDPG网络基于输入的状态样本生成状态动作对,利用参数优化的判别器对状态动作对进行判别,当判别结果为1时,认为动作未受到攻击;当判别结果为0时,认为状动作存在异常;当动作存在异常时,且动作幅度差异在阈值范围外,说明动作受到攻击,利用模仿学习网络生成的状态动作对替换DDPG网络生成的状态动作对,以指导DDPG网络在后续阶段的强化学习过程中做出正确决策。
📄 202110598324X
📂 G06N3_092
👤 浙江工业大学
📅 2021-05-31
本发明公开了一种面向深度强化学习模型对抗攻击的防御方法及应用,包括:利用视觉预测模型对输入的前一时刻环境状态进行预测输出预测当前环境状态,并获得预测当前环境状态在深度强化学习策略下的下一帧预测环境状态值;获取深度强化学习模型输出的实际当前环境状态,并获得实际当前环境状态在深度强化学习策略下添加扰动的环境状态值;利用判别模型对预测环境状态值和添加扰动的环境状态值进行判别,根据判别结果获得深度强化学习模型是否被攻击;在深度强化学习模型被攻击时,提取实际当前环境状态,利用两个防御模型对实际当前环境状态进行防御;深度强化学习模型利用防御后的实际当前环境状态进行学习预测输出。
📄 2019111840513
📂 G06F21_55
👤 浙江工业大学
📅 2019-11-27
本发明提供移动场景下基于信号增强的深度强化学习带宽估计方法,涉及移动通信技术领域,包括采集网络传输状态数据,将RSSI值归一化并滤波,构建包含网络传输状态特征、时序特征和RSSI值的状态空间,输入演员‑评论家结构的深度强化学习模型进行带宽预测,并基于RSSI值差异触发带宽保护机制。本发明能有效提高移动场景下带宽预测精度,降低网络波动影响,提升信号传输质量。
📄 202511174543X
📂 H04W72_0457
👤 浙江工业大学
📅 2025-08-21
本发明属于抗干扰技术领域,具体涉及一种基于深度强化学习干扰估计器的高性能抗干扰方法。该控制器包括:输入信号内模、状态反馈控制器、等价输入干扰估计器和状态观测器,所述等价输入干扰估计器,用于对控制系统总和扰动进行估计,通过在系统控制输入中加入对扰动估计的补偿,可有效主动抑制系统总和扰动影响,所述滤波器采用深度Q网络学习调整增益,可改变系统控制性能从而自适应调整扰动估计和噪声衰减能力。本发明通过深度强化学习方法在时变扰动及不确定测量噪声环境下自动学习滤波器增益,针对突变扰动可快速重构扰动信号,在慢变扰动时可有效抑制噪声放大,从而有效提高运动控制系统的综合性能,进而实现机械加工过程中的高精控制。
📄 2023108738060
📂 G05B13_04
👤 浙江工业大学
📅 2023-07-17
一种基于深度强化学习的移动机器人导航避障方法,利用神经网络提取机器人和每个人之间成对交互的特征,并通过局部地图捕捉人类之间的交互;用一个自我注意机制来聚合交互特征推断出相邻人类相对于其未来状态的相对重要性,并且利用强化学习的方法来预训练价值网络,训练过程中加入安全行动空间,防止突发情况的发生;建立二维网格地图,通过设定全局目标点,利用RRT*算法规划出一条全局路径,再以机器人的当前位置为圆心,r为半径的圆内找到最近的点,将其设为动态局部目标,通过最优策略选择最优动作,最终实现移动机器人导航避障功能。本发明解决现有导航避障过程中机器人短视、反应慢等问题。
📄 2021105758468
📂 G05D1_02
👤 浙江工业大学
📅 2021-05-26
一种基于深度强化学习的移动边缘计算速率最大化方法,包括以下步骤:1)在一个由一个基站和多个无线设备组成由无线供电的边缘计算系统中,计算出在给出模式选择下系统中所有无线设备的速率总和;2)通过强化学习算法来寻找一个最优的模式选择,即所有无线设备的模式选择M0和M1;3)所有无线设备的模式选择M0和M1作为强化学习的系统状态xt,动作a则是对系统状态xt的更改,如果改后的系统的总计算速率比之前的要大,则使当前奖励r(xt,a)设为正值,反之设为负值,同时系统进入下一状态xt+1,不断重复这个迭代过程直到得到最佳模式选择M0和M1。本发明在保证用户体验的前提下最大化所有无线设备的总和计算速率。
📄 2018103423595
📂 H04W24_02
👤 浙江工业大学
📅 2018-04-17
本发明公开了一种基于深度强化学习的预测式外呼任务分配方法及外呼系统,该方法能根据不同的外呼状态预测输出适当的外呼量。首先根据外呼系统工作流程对外呼进行数学建模,构建虚拟外呼环境。然后使用ε‑Greedy方法在外呼环境中进行半随机呼出,同时使用强化学习方法对半随机呼出进行学习,即从不同状态下不同外呼量的价值差异中进行学习,使深度神经网络近似外呼量的价值函数。最后使用深度神经网络对实际外呼状态下不同外呼量的价值进行预测,然后选择最好的外呼量进行输出。本发明构建的基于深度强化学习的预测式外呼任务分配方法在满足降低呼损、减少坐席空闲时间目标的同时具有快速输出、合理预测的特点。
📄 2021112025071
📂 H04M3_523
👤 浙江工业大学
📅 2021-10-15
本发明公开了一种基于最优反例和障碍函数的安全深度强化学习方法,该方法包括以下步骤,利用标准化流技术,构造基于反例样本分布的非负的未标准化的目标概率分布函数,基于该目标分布训练标准化流模型;使用训练好的标准化流模型进行反例样本的采样;将生成的反例样本,用于引导障碍函数网络进行更加精细化的修正训练,通过不断生成并补充反例样本,进行深度强化学习训练,最终学习到正确障碍函数。与现有技术相比,本发明通过最优反例样本生成技术,优化了障碍函数和强化学习的归纳迭代训练效率,并且提高了形式化验证的效率。
📄 2024118437971
📂 G06N3_092
👤 西南大学
📅 2024-12-14
本发明公开了一种用于理解DQN模型的可视分析方法,包括如下步骤:步骤一,定义参数集合,选取DQN模型的运行环境;步骤二,训练所述DQN模型,测试训练好的所述DQN模型,保存中间数据;步骤三,设计Q值分布视图,展示不同的所述Q值数据对应的不同运行环境的情况,分析所述Q值数据的计算规律;步骤四,设计卷积层分析视图,用于呈现训练过程中感受野范围和影响所述智能体做出相应动作的重要因素;步骤五,设计时间序列视图,用于展示测试过程中的运行过程。
📄 2020103113204
📂 G06N3_0464
👤 杭州电子科技大学
📅 2020-04-20
本发明公开了一种基于深度强化学习的EFSM输入序列生成方法,将输入序列生成问题看作是一个复杂的优化问题,求解最优解的过程就是利用元启发式算法对可执行路径中的每条变迁搜索满足其谓词判断条件的输入参数解;其中,元启发式算法被使用强化学习算法训练好的智能体来代替,智能体通过在本发明设计的动作空间内选择动作来改变输入参数的值,然后根据奖赏函数获取对应的奖赏值以指导下一步动作的选择。本发明可以根据各种客观测试路径有效地生成新的输入序列,可以有效地提高EFSM模型输入序列生成的效率和成功率,并能够在进行回归测试和测试用例生成应用中有效地减少输入序列生成的时间开销。
📄 2022103923126
📂 G06F11_36
👤 浙江理工大学
📅 2022-04-15
本发明涉及边缘计算技术领域,具体为基于深度强化学习的边缘计算服务器信息处理系统,系统包括节点响应识别模块、干扰节点筛除模块、节点适配选择模块、节点状态聚合模块、干扰避让调控模块。本发明中,通过提取任务调配速率、带宽比例与节点能耗表现构建任务行为类别群组,结合轨迹变化与响应同步信息实现任务动态特征识别与精细分类,筛除路径中异常分布节点提升节点筛选精度与路径纯净性,依据资源需求上限与节点状态建立匹配机制优化任务分配与资源使用,聚合节点状态序列识别轨迹重合区域增强资源波动趋势感知能力,调整路径间隔与缓存堆积周期的耦合关系实现路径重构与任务负载均衡。
📄 2025109992212
📂 G06F9_50
👤 闽南理工学院
📅 2025-07-21