本发明公开了一种基于强化学习算法SAC的目标跟踪方法、装置及存储介质,方法包括:获取视频数据;在视频数据的当前帧中确定搜索区域位置和大小;判断当前帧是否为第一帧;响应于当前帧非第一帧,将当前帧输入预训练好的actor网络模型进行特征提取,得到输出的预测框,根据所述预测框对目标进行跟踪;其中所述actor网络模型的训练方法,包括:通过第一帧对actor、target_actor网络进行初始化,根据经验池中存储的数据,通过actor、critic网络计算动作,计算actor、critic1、critic2网络损失,利用强化学习SAC算法更新网络权值。将目标跟踪问题转化为强化学习算法中在线决策的问题,并且本发明只需要少量数据集,充分利用现有技术,提升训练速度。
📄 2022102402738
📂 G06T7_246
👤 南京邮电大学
📅 2022-03-10
本发明公开了一种面向强化学习的异常数据检测防御方法,包括:(1)搭建小车自动驾驶环境,并基于根据小车自动驾驶环境提供的状态数据,采用深度确定性策略梯度算法进行强化学习,生成驾驶状态数据作为训练样本;(2)利用所述训练样本训练由生成器和判别器组成的生成式对抗网络;(3)采集的驾驶状态数据,利用训练好的生成器生成根据当前时刻驾驶状态数据得到的下一时刻的预测驾驶状态数据;(4)利用训练好的判别器判别下一时刻的真实驾驶状态数据和预测驾驶状态数据是否正常,当下一刻的真实驾驶状态数据异常,预测驾驶状态数据正常,利用预测驾驶状态数据替换真实驾驶状态数据。
📄 2020100718775
📂 G06N3_08
👤 浙江工业大学
📅 2020-01-21
本发明属于网络安全和机器学习技术领域,公开了一种融合强化学习与HER算法的可迁移自动渗透测试方法及介质,包括将渗透测试过程建模为马尔科夫决策过程,使用DQN模型构建自动渗透测试的基础模型;在基础模型的MDP任务结构中增加目标状态,并根据目标状态重构经验池中经验样本的数据格式,得到渗透测试模型;在渗透测试模型的训练过程中,根据经验池中的经验样本生成新的经验样本,直至训练完成输出训练场景下最优的渗透测试模型;针对新场景构建新的渗透测试模型,并将训练场景下最优的渗透测试模型的参数迁移至新的渗透测试模型;冻结新的渗透测试模型中迁移得到的参数训练新的渗透测试模型。本发明加速模型收敛,更高效获得最优渗透策略。
📄 2024119442040
📂 G06F21_57
👤 浙江工业大学
📅 2024-12-27
一种基于多级算子变异的强化学习框架安全性检测方法,包括:1)强化学习源模型训练:利用强化学习智能体与环境的交互进行目标导向学习,得到初始强化学习智能体模型Mo;2)针对原始强化学习智能体模型Mo,针对性设计潜在缺陷;设计变异算子,将不同级别的变异算子安插在原始强化学习智能体模型Mo中;3)修改初始强化学习环境中设计测试环境,并且设计针对于强化学习系统的突变分数,突变得分是被消灭的突变体的数量和突变体总体总数的比率;S4)将原始强化学习智能体模型Mo和变异强化学习智能体模型MM根据不同的测试环境进行游戏测试,将生成的变异测试分数进行比对,从而判定该框架是否此类型的漏洞。
📄 2022113583440
📂 G06F18_214
👤 浙江工业大学
📅 2022-11-01
本发明公开了基于大型离散动作空间的强化学习优化方法、方法及装置。所述优化方法包括:将状态输入策略网络以得到原始动作,并基于KNN算法获取大型离散动作集内与所述原始动作距离相近的若干离散动作;将获取的各所述离散动作输入价值网络以筛选出最佳动作,并使模型执行所述最佳动作以获得样本;循环执行上述步骤以获得若干所述样本,并按照获取顺序依次间隔选取部分所述样本存储于缓冲池内;基于所述缓冲池训练所述模型并更新所述策略网络及所述价值网络;循环执行上述所有步骤直至得到最优的策略网络及价值网络。所述方法及所述优化装置均基于所述优化方法进行。本发明在进行模型训练时具有训练速度快,且对动作泛化能力强的优点。
📄 2022106552950
📂 G06F18_2413
👤 安徽工业大学
📅 2022-06-10
本发明公开了一种融合数据驱动与强化学习的人群疏散仿真方法和系统,所述方法包括:获取真实视频数据,根据视频数据进行人群追踪;根据运动相似性对人群进行群组划分,并获取各群组的路径信息;初始化场景信息和人群位置,将所述人群进行群组划分;根据视频中群组的路径信息,结合强化学习训练最优策略,实现场景中群组的路径规划;根据各群组的路径信息生成群组内个体的路径;进行个体间碰撞检测,并与视频数据中人群运动进行实时耦合,实现人群运动仿真。本发明能够在动态环境中逼真地仿真人群的社会行为,在体现人群的自组织现象的同时减少对真实数据量的依赖,为人群疏散方案的制定提供借鉴。
📄 2018113827078
📂 G06F30_27
👤 山东数据交易有限公司
📅 2018-11-20
本发明公开了基于协同强化学习的动态云内容分发网络内容放置方法,包括:建立动态云内容分发网络;将网络中所有云代理服务器看成节点,确定源节点和目的节点集合;基于源节点和目的节点建立基于协同强化学习的动态CCDN内容放置模型CRL‑CPM;在CRL‑CPM的基础上,通过基于CRL的时变分发树构建算法构建一棵时变分发树,利用分发树进行内容分发。
📄 202010408027X
📂 H04L67_63
👤 山东数据交易有限公司
📅 2020-05-14
本发明涉及一种基于Q学习的资源分配方法,属于通信技术领域。在该方法中,工作在免授权频谱的蜂窝小基站根据网络流量的实时情况,动态地为D2D‑U用户分配发射功率和时间资源,在保证同一频段上蜂窝用户的通信质量的条件下,使得D2D‑U系统与WiFi系统公平共存,同时最大化共存系统的吞吐量。在该方法下,蜂窝小基站充当智能体,智能体的动作定义为发射功率和免授权信道占空比的不同组合,智能体的状态由蜂窝用户的信噪比、共存系统的吞吐量和公平性的不同组合所组成。本发明能够提升用户的通信质量,提高异构系统在免授权频段上的公平性,同时获得较高的共存系统吞吐量。
📄 2021100751814
📂 H04W72_04
👤 重庆邮电大学
📅 2021-01-20
本发明公开了一种基于强化学习的在线多工作流调度方法。本发明首先建立系统模型来表征移动设备、边缘服务器、任务和节点。其次建立节点卸载规则,移动设备可选择将节点卸载到边缘服务器上或者留在本地执行。然后建立时间线模型,记录所有任务的到达事件以及节点的执行完成事件。再建立基于强化学习的在线多工作流调度策略,定义调度问题的状态空间和动作空间,并设计调度问题的奖励函数。最后设计一种基于策略梯度的求解在线多工作流调度问题算法用于调度策略实现。本发明基于图卷积神经网络提取的特征进行卸载决策与资源分配,能够实时分析当前的工作流以及服务器的状态,复杂度低,尽可能地降低所有工作流的平均完成时间。
📄 2022108579888
📂 G06F9_50
👤 杭州电子科技大学
📅 2022-07-20
本发明提供了一种基于强化学习的多智能体容错一致性方法及系统,本发明方法:S1:建立系统网络拓扑,设计奖励函数;S2:智能体之间交互:根据设计的奖励函数,逐步调整相邻智能体权重,直至正常智能体状态达成一致。本发明通过引入MARL的试错思想,即不断地尝试,并采用一种可应用于解决多智能体容错一致性问题的算法D‑OPDPG,结合MARC系统的自然特性来解决现有技术的一些问题,根据设计的奖励函数,逐步调整相邻智能体权重,从而减轻故障智能体的影响,进而逐渐识别出故障智能体。本发明在不给系统增加额外的能耗下,对噪声有着极高的容忍度。此外,采用基于强化学习的分布式方法,放宽了网络拓扑的限制条件,其仅需网络拓扑满足连通图要求。
📄 2021111849500
📂 G06N3_084
👤 浙江理工大学
📅 2021-10-11
本发明提供了一种基于分布式协同采样中心式优化的强化学习训练系统,包括强化学习算法模块、优先级队列缓存模块、远端奖励回溯模块、中心式优化模块、分布式机器,同时还提供了上述系统的训练方法,是通过对多组分布式采样机,采集仿真环境实例数据库中多组环境案例,进行与服务端之间的信息交互,输出对应环境案例的轨迹数据给客户端;再通过强化学习算法模块的进行配置强化学习算法模型、初始化参数该系统,还提供了上述系统的方法是通过分布式协同采样、C/S架构模式,结合奖励回溯技术,解决强化学习训练系统满足大规模强化学习训练问题,具备优秀的普适性,较高的采样效率。
📄 2020110326582
📂 G06F9_455
👤 南京星耀智能科技有限公司
📅 2020-09-27
本专利公开了一种基于改进DQN算法的中继无人机多样性资源调度方法,该方法包括以下步骤:为多样性需求的无人机中继通信场景建立数学模型;将该数学模型转化为马尔可夫决策模型;将改进的DQN算法应用于该决策模型。所公开的改进的DQN算法相较于原DQN算法做出3点改进:引入了双网络结构,以缓解存在的过度估计问题;将随机采样调整为重要性采样策略,引入优先经验回放机制,减少了样本选择的偏差,提升算法的训练效果和收敛性;将评估网络中的线性层替换为噪声层,帮助算法平衡探索与开发,增加模型的泛化能力。本发明能获得更高的数据吞吐量和用户服务水平,能更好的适应拥有多样性需求的复杂多变的无人机中继通信场景。
📄 2024108719670
📂 H04B7_185
👤 湖南科技大学
📅 2024-07-01