摘要
本发明公开了基于时态逻辑控制策略的多机器人流水线组装方法及系统包括:基于奇偶校验博弈合成时态逻辑的控制策略表述机器人的任务规约,根据合成策略的接受条件构建带有势能函数的奖励自动机对机器人的行为赋予奖励值;将由秩为1的广义反应性规约的机器人组的综合策略分解为每个机器人的奖励自动机,并在MDP上扩展带有势能的奖励自动机;提出基于价值迭代的奖励塑造算法和分散式Q‑学习算法提升机器人组学习到最优策略的速度;本发明基于时态逻辑捕捉任务的时态属性将生成的综合策略分解为多个个体奖励自动机引导机器人学习最优策略,并提出基于价值迭代的奖励塑造算法提高机器人群学习到最优组装策略的效率和避免陷入局部最优的问题。