本发明公开一种基于先验知识嵌入的LSTM‑PPO模型的智能干扰决策方法及系统,属于人工智能和机器学习领域;其方法包括对多功能雷达环境MFR进行建模,得到环境模型;将MFR干扰决策问题定义为马尔可夫决策过程;基于环境模型的势能函数的重塑奖励理论将先验知识以重塑奖励的形式嵌入PPO模型,以引导智能体快速收敛;使用LSTM代理PPO算法嵌入强化学习模型,用于捕捉回波数据的动态特征以有效刻画雷达工作状态,提升干扰决策精度和稳定性。本发明具有较高的决策效率以及有效性,因而可高效稳健地达成多功能雷达干扰策略。本发明可以基于多功能雷达环境下在算法的收敛速度、稳定性以及执行干扰决策的性能方面均有显著优势。
📄 2024107854317
📂 G01S7_38
👤 浙江理工大学
📅 2024-06-18