一种基于深度强化学习的交通信号控制方法,首先采用了近端策略优化和广义优势估计等技术提升了模型的整体性能,其次设计了新的奖励值函数,显著提升了模型的收敛速度,而且,模型生成的信号配时方案相位顺序固定,相邻周期配时差异较小,具有更高的安全性和实用性,最后,训练好的模型可以在实际交通环境中进行持续优化,更好地满足变化的交通需求。基于真实交通流量数据的实验结果表明:该方法能够有效应对平峰和高峰两种流量模式,与其它模型相比,平均排队长度、平均旅行时间和车辆平均延误等常见评价指标明显降低,而且模型收敛的时间也明显缩短。
📄 2020109784819
📂 G08G1_08
👤 浙江工业大学
📅 2020-09-17
本发明公开了一种基于深度强化学习的离散制造车间鲁棒调度优化方法,包括:取历史加工数据,利用神经网络拟合工序加工时长关于设备、操作员以及生产初始时刻的函数;建立工厂车间的加工环境模型,加工环境模型包括可运行设备数量、在岗操作员以及中间产品的库存数;获取当天需要加工的产品数量;根据加工环境模型以及当天需要加工的产品数量构建离散制造车间鲁棒调度问题,该离散制造车间鲁棒调度问题的目标函数为最小化最大完工时间与最小化完工时间同交付时间的差值;对离散制造车间鲁棒调度问题进行求解。本发明能够得到更加符合实际、更具鲁棒性的生产方案。
📄 2022107497058
📂 G06Q10_0631
👤 浙江工业大学
📅 2022-06-28
本发明公开了一种基于深度强化学习的移动无线供能物联网资源分配方法,在时隙的控制阶段,混合接入点在接收到接收范围内所有的物联网节点发送的包含自身当前剩余能量和数据包数量的状态信息后,基于深度强化学习得到资源分配信息,混合接入点把资源分配信息通过控制信道广播给接收范围内所有的物联网节点。在时隙的数据传输阶段,收到来自混合接入点的广播数据后,根据自身的信道获得情况选择是否发送数据。在时隙的能量捕获阶段,物联网节点进行能量捕获。混合接入点通过当前时隙获得的物联网节点的状态信息、资源分配结果和吞吐量训练深度强化学习。本发明增加了网络资源的利用率,达到节能并提高无线供能物联网总吞吐量的目的。
📄 2023107652363
📂 H04W72_04
👤 浙江工业大学
📅 2023-06-27
一种基于深度强化学习的非正交接入最优解码排序上行传输时间优化方法,包括以下步骤:(1)在给定一种解码排序πm的条件下,优化问题描述为一个非凸性优化问题;(P1‑m)问题是在给定智能终端上传量的情况下找到最优的整体无线资源消耗,观察(P1‑m)问题知道它的目标函数只有一个变量;(2)和(3)通过深度强化学习算法来找到一个最优的上行传输时间,使得有最优的整体无线资源消耗;(4)提出算法OptOrder‑Algorithm找到最优的解码排序,再联合深度强化学习算法,输出全局最小整体无线资源消耗和全局最优上行传输时间。本发明提高了系统传输效率,获得更优质的无线网络体验质量,使得有最优的整体无线资源消耗。
📄 2018106615065
📂 H04W72_12
👤 浙江工业大学
📅 2018-06-25
本发明公开了一种基于深度强化学习的超密集车联网自适应资源分配方法,该方法包括:建立超密集车联网的通信模型,所述通信模型中包括基站、发送车辆和接收车辆,基站通过V2I链路与车辆交换数据,车辆之间通过V2V链路通信;根据通信模型中车辆之间的干扰关系,确定以接收车辆为中心的加权干扰模型;根据通信模型和加权干扰模型,建立通信模型的资源分配模型,所述资源分配模型为在一定约束条件下以资源重用率最大且所分配的资源不冲突为目标的优化问题;将所述优化问题转化为马尔可夫决策过程问题;利用FedAvg‑AC算法进行求解,得到超密集车联网的资源分配策略。本发明有益效果提高了资源分配的效率。
📄 2025100100949
📂 H04W72_541
👤 重庆理工大学
📅 2025-01-03
本发明属于工业互联网领域,具体涉及一种基于注意力机制和深度强化学习的SDN多路径路由方法,包括:利用SDN获取全局网络拓扑信息,并周期性采集网络中的实时链路信息和数据流量信息;计算待转发流从源到目的节点之间的多条备选转发路径;将待转发的数据流量从原本单路径承担的数据流量拆分为多条路径的网络数据流;采用基于CNN的注意力机制对多条备选转发路径的链路状态信息进行特征提取;根据提取的特征计算网络数据流的转发路径并传输。本发明将传统的多路径路由和SDN和深度强化学习结合在一起,可以满足用户对不同QoS业务流传输要求,并且在充分利用网络资源的同时也降低网络平均端到端传输时延,提升了网络性能和服务质量。
📄 2023101382905
📂 H04L45_243
👤 重庆邮电大学
📅 2023-02-20
本发明涉及无线通信技术领域,具体为一种移动边缘计算下基于深度强化学习的任务卸载方法,包括:根据移动用户到达的任务,建立一个队列模型来描述移动用户的任务卸载问题;根据任务卸载的目标服务器及任务量设定约束条件;在约束条件下,采用一种无模型的强化学习机制构建以最小化系统成本为目标的优化问题;利用深度强化学习DDPG进行求解最优卸载策略;根据本发明可以实现在不知道信道状态信息的情形下,通过探索和训练来自适应调整MEC系统的任务卸载策略,实现系统的卸载成本最小化,提升用户体验。
📄 2020101901867
📂 G06F9_50
👤 重庆邮电大学
📅 2020-03-18