发明专利 已授权

一种基于最优反例和障碍函数的安全深度强化学习方法

📄 申请号:CN202411843797.1 📄 发布日:2026/08/04

著录项目信息

申请日
2024-12-14
公开号
CN119721177B
公开日
2025-10-10
申请人
西南大学
法律状态
已下证
专利类型
发明
主分类号
IPC 分类号

技术画像

应用场景

自动驾驶, 机器人控制, 工业自动化, 智能决策系统, 航空航天控制

摘要

本发明公开了一种基于最优反例和障碍函数的安全深度强化学习方法,该方法包括以下步骤,利用标准化流技术,构造基于反例样本分布的非负的未标准化的目标概率分布函数,基于该目标分布训练标准化流模型;使用训练好的标准化流模型进行反例样本的采样;将生成的反例样本,用于引导障碍函数网络进行更加精细化的修正训练,通过不断生成并补充反例样本,进行深度强化学习训练,最终学习到正确障碍函数。与现有技术相比,本发明通过最优反例样本生成技术,优化了障碍函数和强化学习的归纳迭代训练效率,并且提高了形式化验证的效率。
权利要求书 (12项) 说明书 附图

……

……

图1
图2
图3

法律状态时间线

议价
不含过户费

📋 交易方式: 委托待转让 📌 交易状态: 在售 👁️ 浏览次数:16 ❤️ 收藏人数:93 📋 项目申报: 未申报

资金托管 权属尽调 包过户
🏢 淄博智来知识产权服务有限公司
✓ 企业认证✓ 手机绑定历史成交 0件好评率 98.5%

📊 出价记录 (3条)
王**¥-10万
李** 企业¥-8万
陈**¥-3万
查看全部出价