摘要
本发明公开了一种面向足球对战的数据驱动强化学习方法,包括:1、在网络平台上采集足球博弈所需的数据;2、对步骤1的数据进行预处理,得到预处理数据;3、构建离线强化学习网络模型;4、基于预处理数据,对离线强化学习网络模型进行训练及测试,得到训练完成的模型;5、基于训练完成的模型,解决谷歌足球环境中各智能体的决策问题。本发明使用离线强化学习的思想解决谷歌足球环境,使用Transformer强大的预测能力来增加算法效果,不仅可以增加训练速度,对比当前的离线强化学习算法在稀疏环境的效果也有不错的提升。