本发明公开了一种面向强化学习的异常数据检测防御方法,包括:(1)搭建小车自动驾驶环境,并基于根据小车自动驾驶环境提供的状态数据,采用深度确定性策略梯度算法进行强化学习,生成驾驶状态数据作为训练样本;(2)利用所述训练样本训练由生成器和判别器组成的生成式对抗网络;(3)采集的驾驶状态数据,利用训练好的生成器生成根据当前时刻驾驶状态数据得到的下一时刻的预测驾驶状态数据;(4)利用训练好的判别器判别下一时刻的真实驾驶状态数据和预测驾驶状态数据是否正常,当下一刻的真实驾驶状态数据异常,预测驾驶状态数据正常,利用预测驾驶状态数据替换真实驾驶状态数据。
📄 2020100718775
📂 G06N3_08
👤 浙江工业大学
📅 2020-01-21
本发明属于网络安全和机器学习技术领域,公开了一种融合强化学习与HER算法的可迁移自动渗透测试方法及介质,包括将渗透测试过程建模为马尔科夫决策过程,使用DQN模型构建自动渗透测试的基础模型;在基础模型的MDP任务结构中增加目标状态,并根据目标状态重构经验池中经验样本的数据格式,得到渗透测试模型;在渗透测试模型的训练过程中,根据经验池中的经验样本生成新的经验样本,直至训练完成输出训练场景下最优的渗透测试模型;针对新场景构建新的渗透测试模型,并将训练场景下最优的渗透测试模型的参数迁移至新的渗透测试模型;冻结新的渗透测试模型中迁移得到的参数训练新的渗透测试模型。本发明加速模型收敛,更高效获得最优渗透策略。
📄 2024119442040
📂 G06F21_57
👤 浙江工业大学
📅 2024-12-27
一种基于多级算子变异的强化学习框架安全性检测方法,包括:1)强化学习源模型训练:利用强化学习智能体与环境的交互进行目标导向学习,得到初始强化学习智能体模型Mo;2)针对原始强化学习智能体模型Mo,针对性设计潜在缺陷;设计变异算子,将不同级别的变异算子安插在原始强化学习智能体模型Mo中;3)修改初始强化学习环境中设计测试环境,并且设计针对于强化学习系统的突变分数,突变得分是被消灭的突变体的数量和突变体总体总数的比率;S4)将原始强化学习智能体模型Mo和变异强化学习智能体模型MM根据不同的测试环境进行游戏测试,将生成的变异测试分数进行比对,从而判定该框架是否此类型的漏洞。
📄 2022113583440
📂 G06F18_214
👤 浙江工业大学
📅 2022-11-01
本发明公开了基于大型离散动作空间的强化学习优化方法、方法及装置。所述优化方法包括:将状态输入策略网络以得到原始动作,并基于KNN算法获取大型离散动作集内与所述原始动作距离相近的若干离散动作;将获取的各所述离散动作输入价值网络以筛选出最佳动作,并使模型执行所述最佳动作以获得样本;循环执行上述步骤以获得若干所述样本,并按照获取顺序依次间隔选取部分所述样本存储于缓冲池内;基于所述缓冲池训练所述模型并更新所述策略网络及所述价值网络;循环执行上述所有步骤直至得到最优的策略网络及价值网络。所述方法及所述优化装置均基于所述优化方法进行。本发明在进行模型训练时具有训练速度快,且对动作泛化能力强的优点。
📄 2022106552950
📂 G06F18_2413
👤 安徽工业大学
📅 2022-06-10
本发明公开了一种融合数据驱动与强化学习的人群疏散仿真方法和系统,所述方法包括:获取真实视频数据,根据视频数据进行人群追踪;根据运动相似性对人群进行群组划分,并获取各群组的路径信息;初始化场景信息和人群位置,将所述人群进行群组划分;根据视频中群组的路径信息,结合强化学习训练最优策略,实现场景中群组的路径规划;根据各群组的路径信息生成群组内个体的路径;进行个体间碰撞检测,并与视频数据中人群运动进行实时耦合,实现人群运动仿真。本发明能够在动态环境中逼真地仿真人群的社会行为,在体现人群的自组织现象的同时减少对真实数据量的依赖,为人群疏散方案的制定提供借鉴。
📄 2018113827078
📂 G06F30_27
👤 山东数据交易有限公司
📅 2018-11-20
本发明公开了基于协同强化学习的动态云内容分发网络内容放置方法,包括:建立动态云内容分发网络;将网络中所有云代理服务器看成节点,确定源节点和目的节点集合;基于源节点和目的节点建立基于协同强化学习的动态CCDN内容放置模型CRL‑CPM;在CRL‑CPM的基础上,通过基于CRL的时变分发树构建算法构建一棵时变分发树,利用分发树进行内容分发。
📄 202010408027X
📂 H04L67_63
👤 山东数据交易有限公司
📅 2020-05-14
本发明涉及一种基于Q学习的资源分配方法,属于通信技术领域。在该方法中,工作在免授权频谱的蜂窝小基站根据网络流量的实时情况,动态地为D2D‑U用户分配发射功率和时间资源,在保证同一频段上蜂窝用户的通信质量的条件下,使得D2D‑U系统与WiFi系统公平共存,同时最大化共存系统的吞吐量。在该方法下,蜂窝小基站充当智能体,智能体的动作定义为发射功率和免授权信道占空比的不同组合,智能体的状态由蜂窝用户的信噪比、共存系统的吞吐量和公平性的不同组合所组成。本发明能够提升用户的通信质量,提高异构系统在免授权频段上的公平性,同时获得较高的共存系统吞吐量。
📄 2021100751814
📂 H04W72_04
👤 重庆邮电大学
📅 2021-01-20
本发明公开了一种基于强化学习的在线多工作流调度方法。本发明首先建立系统模型来表征移动设备、边缘服务器、任务和节点。其次建立节点卸载规则,移动设备可选择将节点卸载到边缘服务器上或者留在本地执行。然后建立时间线模型,记录所有任务的到达事件以及节点的执行完成事件。再建立基于强化学习的在线多工作流调度策略,定义调度问题的状态空间和动作空间,并设计调度问题的奖励函数。最后设计一种基于策略梯度的求解在线多工作流调度问题算法用于调度策略实现。本发明基于图卷积神经网络提取的特征进行卸载决策与资源分配,能够实时分析当前的工作流以及服务器的状态,复杂度低,尽可能地降低所有工作流的平均完成时间。
📄 2022108579888
📂 G06F9_50
👤 杭州电子科技大学
📅 2022-07-20
本发明提供了一种基于强化学习的多智能体容错一致性方法及系统,本发明方法:S1:建立系统网络拓扑,设计奖励函数;S2:智能体之间交互:根据设计的奖励函数,逐步调整相邻智能体权重,直至正常智能体状态达成一致。本发明通过引入MARL的试错思想,即不断地尝试,并采用一种可应用于解决多智能体容错一致性问题的算法D‑OPDPG,结合MARC系统的自然特性来解决现有技术的一些问题,根据设计的奖励函数,逐步调整相邻智能体权重,从而减轻故障智能体的影响,进而逐渐识别出故障智能体。本发明在不给系统增加额外的能耗下,对噪声有着极高的容忍度。此外,采用基于强化学习的分布式方法,放宽了网络拓扑的限制条件,其仅需网络拓扑满足连通图要求。
📄 2021111849500
📂 G06N3_084
👤 浙江理工大学
📅 2021-10-11
本发明公开了一种基于强化学习的关系型数据库查询优化方法及系统,方法包括以下步骤:步骤1:通过树卷积神经网络提取逻辑计划树及优化器状态信息特征;步骤2:利用强化学习模型获得匹配的优化规则应用顺序;步骤3:优化器选择适合当前查询的优化规则;系统包括规则应用与信息采集模块、机器学习模块和数据交换模块;所述规则应用与信息采集模块和机器学习模块通过数据交换模块连接,通过本地RPC请求实现数据库与规则应用与信息采集模块和机器学习模块的数据交互。本发明使用强化学习让数据库能够根据当前处理的SQL查询语句自动选择每一步的逻辑优化规则,增加了逻辑优化的可扩展性,提高了逻辑优化阶段的灵活性,进而提高数据查新效率。
📄 2021104755903
📂 G06F16_2453
👤 浙江辰鹿信息科技有限公司
📅 2021-04-29
本发明公开了一种基于强化学习驱动大模型自适应提示的推荐方法及系统,本发明方法包括获取用户画像文本并进行语义相似度匹配以确定用户对应的提示词类型;通过深度Q网络DQN、置信上限算法UCB在预设的多种提示优化策略选择推荐的提示优化策略并获得提示优化策略S;基于提示优化策略S和用户对应的提示词类型利用大模型生成优化后的提示词,利用推荐系统进行验证和性能指标评估;继续迭代直至满足预设的结束条件以得到优化后的提示词以应用于目标推荐系统。本发明旨在通过引入细粒度用户画像和强化学习驱动大模型为不同用户群体进行个性化提示优化的机制,解决现有推荐技术中软提示模板僵化、个性化不足的问题,提升推荐准确性。
📄 2025113314452
📂 G06F16_9535
👤 湖南师范大学
📅 2025-09-18
本发明公开一种基于Q学习的自主水下航行器协助下水下数据收集方法,涉及水下传感器网络数据收集技术领域。该方法包括:划分水下监测区域,每个区域生成基于最优刚性图的传感器网络;采用Q学习算法对传感器进行局部路由决策;自主水下航行器根据数据值和位置选择目标数据收集器;采用Q学习算法规划自主水下航行器到达目标点的路径;自主水下航行器在PD控制器控制下对规划路径跟踪。当到达自主水下航行器规定访问时间后,自主水下航行器上浮至水面,将数据传送到控制中心,完成本周期数据收集任务。本发明可以在水流环境中及存在环境障碍下工作,具有平衡和降低能耗,提高网络稳定性,提高传输成功率等优点。
📄 2021100320226
📂 H04W4_021
👤 燕山大学
📅 2021-01-11