摘要
本发明公开了一种基于时态逻辑控制策略的配送机器人路径规划方法,包括步骤:基于奇偶校验博弈合成时态逻辑的控制策略来表述配送机器人的任务规约,根据合成策略的接受条件构建带有势能函数的奖励自动机来对配送机器人的行为赋予奖励值;在原环境的马尔可夫决策过程的基础上设计奖励自动机引导的状态转移函数,使得基于时态逻辑的控制策略可作为顶层策略引导配送机器人学习底层强化学习方法;基于奖励自动机状态图的拓扑排序设计势能函数,解决状态图中存在有向有环图的情况和避免出现配送机器人循环刷分的行为。本发明能提高配送机器人在复杂任务规约下学习配送路径规划的效率和避免收敛到局部最优。