本申请涉及一种基于强化学习的无超调PID控制器参数整定方法。本申请通过构造学习智能体,观测当前状态数据输入到动作神经网络得到动作参数,之后再观测下一状态的数据以及奖励。当前状态,动作,转移后状态,奖励值,四个元素组成了状态转移元组,每一次被控对象执行动作时都会进行一次状态转移,并将状态转移元组存入经验池内。智能体抽取一定量的状态转移元组,用于训练动作网络和评价网络。重复训练动作网络和评价网络直到参数收敛,保存参数权重。最终智能体根据当前状态数据输出最优PID参数提供给PID控制器,使得被控对象的状态值在无超调的基础上以较快的速度达到设定值,进而实现对控制器PID参数无超调整定的方面改进。
📄 2021103599522
📂 G05B11_42
👤 浙江工业大学
📅 2021-04-02
本发明提供了一种基于强化学习的个性化PEEP调节方法,该方法通过构建基于患者整个机械通气过程中的生理数据的强化学习模型,强化学习模型代理根据患者的生理数据推荐在下一时段内该患者的个性化PEEP水平实现个性化PEEP调节。其中,强化学习模型通过构建马尔可夫框架,提取每个患者整个机械通气过程中的生理数据中所有的单步转换元组,以拟合Q迭代算法为核心训练,最终模型学习到的策略为累计回报最大的动作,获得强化学习模型。本发明方法可以通过患者的临床生理数据以使患者获得更好的氧合和预后为目标,实时地推荐个性化呼吸机PEEP设置值,辅助医生的临床决策。
📄 2021102269239
📂 G06N3_092
👤 浙江工业大学
📅 2021-03-01
本发明公开了本发明涉及一种基于Q‑Learning强化学习算法的智能换挡规律控制方法,通过强化学习算法控制挡位的升降,经过反复训练,使AMT始终处于能耗经济性最佳的挡位下工作,解决动态未知工况下,无法实现自适应换挡控制的问题,使得能耗进一步降低,整车动力性和经济性进一步提升。
📄 2021107607566
📂 F16H61_02
👤 聊城大学
📅 2021-07-04
本申请公开了一种基于强化学习的人机共驾控制权切换方法,该方法适用于基于强化学习的人机共驾控制权切换系统对驾驶人与驾驶系统之间驾驶权重的分配,该方法包括:根据驾驶人信息和车路预测信息,计算驾驶操作动作预测指数;将所述驾驶操作动作预测指数与综合驾驶操作动作指数,输入至所述控制权切换系统,计算所述驾驶人与所述驾驶系统之间的所述驾驶权重。通过本申请中的技术方案,有效解决了车辆纵向与横向综合的风险,弱化了驾驶人本身带来的不确定性的影响,对驾驶人进行不同角度的综合考虑从而减少了对驾驶人的判断误差。
📄 2022107586723
📂 B60W60_00
👤 杭州电子科技大学
📅 2022-06-29
本申请公开一种基于强化学习的车联网资源分配方法,包括:车联网环境模块收集当前环境数据传输存放到初始经验回放模块;余弦相似性模块对初始经验回放模块存放数据过滤发送到频谱分配模块和发射功率分配模块用以训练Target网络;基于DQN算法的功率分配模块和基于DDPG算法的发射功率分配模块输出分配动作,经最终策略模块将动作复合,作用于车联网环境模块。本发明通过将环境变化的变量作为参量计算,提高车联网资源分配的可靠性;通过将频谱与功率条件复合分析,使车联网资源分配结果偏差降低;通过对经验回放加入了余弦相似性过滤,使整个系统更快的趋向于收敛。
📄 2022110632182
📂 H04W4_40
👤 华南师范大学
📅 2022-09-01
本发明提供了一种基于强化学习的针对FPGA映射的电路逻辑综合方法,以解决传统网表优化方法中模型优化未见过电路的能力不足的问题。首先构建逻辑综合的数据集,然后对数据集进行预处理,获得电路的统计特征与图结构;随后构建基于强化学习的针对FPGA映射的逻辑综合模型,并利用预处理后的数据集进行预训练,最后利用预训练好的基于强化学习的针对FPGA映射的逻辑综合模型在电路上进行逻辑优化。本发明的电路特征提取模块采用GNN模块对逻辑电路和网表结构进行解析,得到图嵌入,通过FCN模块解析逻辑电路和网表的统计特征,拼接两部分特征得到精确的电路的增强表示状态,提高了强化学习模型对不同电路之间的理解能力。
📄 2025105371063
📂 G06F30_327
👤 杭州电子科技大学
📅 2025-04-27
本发明涉及一种基于强化学习的DTI预测方法、系统、存储介质和装置。主要包括S100、建立药物‑靶标相互作用矩阵Ytrain,建立药物化合物的化学结构相似度矩阵:SIMstrdrug,SIMcosdrug,SIMJacdrug,建立靶标相似度矩阵:SIMstrtar,SIMcostar,SIMJactar,S200、通过Q‑learning算法对SIMstrdrug、SIMcosdrug和SIMJacdrug进行融合操作以及对SIMstrtar、SIMcostar和SIMJactar进行融合操作,获得SIMdrug矩阵和SIMtar矩阵,S300、将SIMdrug矩阵、药物‑靶标相互作用矩阵Ytrain和SIMtar矩阵分别输入到n个模型中训练,n大于等于2,分别获得n个预测分数矩阵,对n个预测分数矩阵初始化权重值,使用Q‑learning算法对各个权重值进行优化,得出最佳权重值,基于最佳权重值对n个预测分数矩阵进行线性加权,获得最终的预测分数矩阵F。本申请的方法预测精度较高。
📄 2023107458024
📂 G16C20_50
👤 苏州科技大学
📅 2023-06-25