本发明公开一种基于深度强化学习的多智能体自主决策方法,应用于多智能体深度强化学习技术领域,针对现有技术在决策过程中未能充分地使用经验数据的问题;本发明通过收集智能体与环境交互生成的经验,以及奖励重塑模块优化环境即时奖励,缓存于本地经验回放池中;然后合并本地经验回放池中的历史经验数据到全局经验回放池PT‑Buffer中,并使用二级优先经验队列进行维护;通过概率求和树从PT‑Buffer采集训练样本数据,来求解目标策略网络和全局Critic网络模型;最后采用更新后的自主决策模型,根据输入的环境局部观测信息直接实现多智能体的自主决策,从而完成相关的多智能体任务。
📄 2023110158152
📂 G06N3_092
👤 电子科技大学长三角研究院(衢州)
📅 2023-08-11
本发明的公开了一种基于神经元覆盖率的深度强化学习鲁棒训练方法和装置,包括以下步骤:(1)搭建智能驾驶环境,从智能驾驶环境中采集状态数据对深度强化学习模型训练,直到达到设定回报值为止;(2)利用训练好的深度强化学习模型在环境中运行,提取多轮的状态动作对;(3)构建用于根据历史状态动作对序列预测未来时刻状态动作对序列的预测器和用于对状态动作对进行质量分类的分类器,并利用提取的状态动作对训练预测器和分类器;(4)依据定义的对抗采样策略,根据状态动作对质量采样状态动作对并进行深度强化学习模型的再训练,以提高深度强化学习模型的鲁棒性。
📄 2021106561156
📂 G06N3_092
👤 浙江工业大学
📅 2021-06-11
本发明公开了一种面向深度强化学习的策略异常检测方法和装置,包括:利用采集的状态样本对DDPG网络进行强化学习;构建包含行动者网络和判别器的模仿学习网络,利用采集的状态样本和专家状态动作对对模仿学习网络进行训练;利用参数优化的DDPG网络基于输入的状态样本生成状态动作对,利用参数优化的判别器对状态动作对进行判别,当判别结果为1时,认为动作未受到攻击;当判别结果为0时,认为状动作存在异常;当动作存在异常时,且动作幅度差异在阈值范围外,说明动作受到攻击,利用模仿学习网络生成的状态动作对替换DDPG网络生成的状态动作对,以指导DDPG网络在后续阶段的强化学习过程中做出正确决策。
📄 202110598324X
📂 G06N3_092
👤 浙江工业大学
📅 2021-05-31
本发明公开了一种基于模仿学习的深度强化学习策略优化防御方法和装置,包括:搭建深度强化学习的智能体自动驾驶模拟环境,基于强化学习中的深度Q网络构建目标智能体,对目标智能体进行强化学习以优化深度Q网络的参数;利用参数优化的深度Q网络产生T个时刻的目标智能体的状态动作对序列作为专家数据,其中,状态动作对中的动作取值对应Q值最小的动作;基于生成式对抗网络构建对抗智能体,并对对抗智能体进行模仿学习,即以专家数据中状态作为生成式对抗网络的输入,以专家数据作为标签来监督优化生成式对抗网络的参数;基于对抗智能体产生的状态对目标智能体进行对抗训练,再优化优化深度Q网络的参数,以实现深度强化学习策略优化防御。
📄 2021102822886
📂 G06N3_092
👤 浙江工业大学
📅 2021-03-16
本发明提供了一种基于强化学习的个性化PEEP调节方法,该方法通过构建基于患者整个机械通气过程中的生理数据的强化学习模型,强化学习模型代理根据患者的生理数据推荐在下一时段内该患者的个性化PEEP水平实现个性化PEEP调节。其中,强化学习模型通过构建马尔可夫框架,提取每个患者整个机械通气过程中的生理数据中所有的单步转换元组,以拟合Q迭代算法为核心训练,最终模型学习到的策略为累计回报最大的动作,获得强化学习模型。本发明方法可以通过患者的临床生理数据以使患者获得更好的氧合和预后为目标,实时地推荐个性化呼吸机PEEP设置值,辅助医生的临床决策。
📄 2021102269239
📂 G06N3_092
👤 浙江工业大学
📅 2021-03-01
本发明涉及一种基于深度强化学习的群智感知激励机制方法,获取参与者位置和移动轨迹信息,将参与者移动过程建模为马尔可夫决策过程,采用深度强化学习预测其在下一个激励周期内的移动轨迹,预测参与者在下一个激励周期结束时的位置分布,通过计算参与者的预测位置分布与数据请求方提供的感知数据目标分布的相对熵,选择大于相对熵阈值区域内的参与者进行激励。本发明避免在同一时间段内对所有参与者进行激励、对同一个参与者在所有激励周期内都进行激励,合理的激励机制解决群智感知参与者收集到的感知数据分布情况与数据请求方提供的目标数据分布之间差异较大、覆盖质量较低的问题;可被广泛应用于移动群智感知领域,降低激励参与者的成本。
📄 2021111077952
📂 G06N3_092
👤 浙江工业大学
📅 2021-09-22
本发明公开了一种基于最优反例和障碍函数的安全深度强化学习方法,该方法包括以下步骤,利用标准化流技术,构造基于反例样本分布的非负的未标准化的目标概率分布函数,基于该目标分布训练标准化流模型;使用训练好的标准化流模型进行反例样本的采样;将生成的反例样本,用于引导障碍函数网络进行更加精细化的修正训练,通过不断生成并补充反例样本,进行深度强化学习训练,最终学习到正确障碍函数。与现有技术相比,本发明通过最优反例样本生成技术,优化了障碍函数和强化学习的归纳迭代训练效率,并且提高了形式化验证的效率。
📄 2024118437971
📂 G06N3_092
👤 西南大学
📅 2024-12-14
本发明公开了一种基于集成的合作多智能体深度强化学习方法,包括如下步骤:步骤1、演员评论家网络或者动作值网络的初始化;步骤2、获取局部观察;步骤3、合作多智能体系统在环境中的决策;步骤4、抽取转移样本;步骤5、训练演员评论家网络或者动作值网络;步骤6、重复步骤2‑5,直至训练结束。这种方法为每个智能体集成多个策略网络或者动作值网络,使得智能体依据能多个策略网络或者动作值网络集成的输出进行决策,以提升智能体决策的鲁棒性。该方法为集成的多个策略网络或者动作值网络使用不同的样本训练进行训练,保证了它们的多样性。有效提升智能体决策的鲁棒性,同时还具有良好的适用性。
📄 2023104534632
📂 G06N3_092
👤 桂林电子科技大学
📅 2023-04-25
本发明涉及人工智能领域,具体地说,一种基于AlexNet网络的强化训练方法,当网络完成一次前向传播后,将网络的输出结果与该图像对应的标签对比,若网络输出结果与标签不同则累加该图像的错分类的次数。当网络Epoch次数大于等于K次时,对训练集中图像的错判次数进行从大到小进行排序,并根据排序结果将被AlexNet网络错分类次数前N的图像进行n倍的数据增强处理,将被网络错分类次数前M‑N(N
📄 2020114067750
📂 G06N3_092
👤 江苏科技大学
📅 2020-12-04
发明
已授权
2023110158152 · 电子科技大学长三角研究院(衢州)
¥0.0 元
发明
已授权
2021106561156 · 浙江工业大学
¥0.0 元
发明
已授权
202110598324X · 浙江工业大学
¥0.0 元
发明
已授权
2021102822886 · 浙江工业大学
¥0.0 元
发明
已授权
2021102269239 · 浙江工业大学
¥0.0 元
发明
已授权
2021111077952 · 浙江工业大学
¥0.0 元
发明
已授权
2024118437971 · 西南大学
¥0.0 元
发明
已授权
2023104534632 · 桂林电子科技大学
¥0.0 元
发明
已授权
2020114067750 · 江苏科技大学
¥0.0 元
🔋 高能量密度固态电解质材料与制备工艺
预算:¥50-100万截止:2026-08-30发布方:××新能源科技响应:8人
交易保障 · 安心交易
资金托管
买家付款至平台,交易完成/过户成功后放款给卖家
权属尽调
专利有效性分析 + 权属状态核查,确保交易安全
成功交易案例
🔬
固态锂电池电解质专利包
转让方:中国科学院××研究所
受让方:××新能源科技有限公司
交易类型:独占许可
交易金额:¥320万
🧬
CRISPR基因编辑技术
转让方:××大学
受让方:××生物医药有限公司
交易类型:转让
交易金额:¥1,200万
⚡
SiC功率器件工艺专利
转让方:××半导体有限公司
受让方:××汽车电子集团
交易类型:转让
交易金额:¥680万
☀️
钙钛矿光伏组件技术
转让方:××科技公司
受让方:××能源集团
交易类型:开放许可
交易金额:¥50万/年