本发明公开了一种基于强扰动检测与模型再训练的深度强化学习交通信号控制中毒防御方法,该方法首先利用强扰动获取输入数据中的后门数据,再对后门数据进行识别进一步确定异常数据点,最后可通过数据层面的防御将测试过程中异常数据的异常数据点进行去除,或是通过模型层面的防御将原始训练数据与反向触发器重构训练集对中毒模型进行忘却学习使得中毒模型忘却触发器引发的异常行为。本发明通过检测方法首先将异常交通状态数据筛选出来,只需在后门数据子集中寻找“反向触发器”而无需对所有输入数据进行计算,最后通过两个层面的防御方法对模型层面和数据层面进行防御,以此消除后门触发器带来的异常行为,提高交叉路口的车辆通行效率。
📄 2022110410011
📂 H04L9_40
👤 浙江工业大学
📅 2022-08-29
基于双流信息瓶颈的深度强化学习行动者‑评价者网络结构及对四轮独立转向独立驱动车辆的路径跟踪控制方法,包括:在Critic网络中,在Q值估计之前加入已知信息瓶颈模块,从中提取已知类信息,并设计训练目标以最小化时间差分误差、最小化互信息、并约束参数范数;在Actor网络中,在策略生成模块之前加入未知信息瓶颈模块,从中提取未知类信息,并设计训练目标以最大化期望累积奖励、最大化互信息、最小化条件熵;在训练过程中,将样本中的状态和动作输入Critic网络和互信息估计器网络,得到Q值估计和互信息估计,并通过最小化目标函数更新Critic网络参数;通过策略梯度定理和重要性采样来更新Actor网络参数,以最大化目标函数;同时,独立训练互信息估计器网络,通过采样和优化实现对互信息的最大化估计;为了实现动态调节,设置权重调度器,根据当前训练轮数和平均回报,动态调整Actor和Critic目标函数中的系数,并使用线性衰减策略进行调节。
📄 2024114316041
📂 G05D1_43
👤 浙江工业大学
📅 2024-10-14
本发明公开了一种基于深度强化学习的卫星探索控制系统及方法,系统包括强化学习模块和环境模块,环境模块包括动作模块、初始化模块、状态更新模块、基础环境模块、奖励计算模块;强化学习模块调用初始化模块,初始化模块对基础环境进行初始化,完成初始化后由初始化模块返回当前状态,强化学习模块在获得当前状态后输出动作给环境模块;环境模块中的动作模块捕获动作进行处理,交由状态更新模块调用基础环境模块来处理当前环境状态更新,再由奖励计算模块获取所有状态和动作信息后给出当前这轮学习的奖励,并将奖励和更新后的状态传递给强化学习模块;强化学习模块结合当前所有的信息构成四元组并进行训练后,再根据下一步状态输出下一个动作。
📄 2023106541999
📂 B64G1_10
👤 浙江理工大学
📅 2023-06-05
本发明属于无人艇航迹控制领域,公开了一种基于深度强化学习的无人艇航迹控制方法。包括如下步骤:用于具有大迟滞性系统的无人艇航迹控制的深度强化学习框架,通过该深度强化学习框架使无人艇这类大迟滞性的非马尔科夫系统也可通过深度强化学习取得良好的训练效果。
📄 2020113530124
📂 G05D1_02
👤 江苏科技大学
📅 2020-11-26