核心观点
该研报针对战场环境中武器-目标分配(WTA)问题,提出了一种基于深度强化学习(DRL)和图神经网络(GNN)的智能决策模型,旨在最大化平台生存概率。传统WTA方法存在模型简化、计算负担重、适应性差等局限性,而DRL方法在表示战场拓扑关系、可扩展性和目标函数实用性方面存在不足。
研究方法
- 将WTA问题建模为部分可观察马尔可夫决策过程(POMDP),并利用高保真度兵棋推演模拟环境进行验证。
- 设计了包含观察特征、基于图的动作表示和奖励结构的POMDP模型。
- 提出了一种GNN-DRL模型,其中GNN用于增强对战场拓扑关系的表示,DRL用于优化决策策略。
关键数据
- 实验涵盖了海军和地面作战等多个军事领域。
- 性能指标为完全生存概率(PCS)。
- 与9种基线方法进行了比较,包括确定性策略和随机策略。
- GNN模型在不同深度结构下的性能进行了比较,并进行了t-SNE可视化分析。
研究结论
- GNN-DRL模型在泛化性和可扩展性方面优于基线方法。
- GNN的实施显著提高了性能。
- 提出的决策策略考虑了拦截器库存状态和距离相关的命中概率,形成了一种复杂的交战策略。
- 未来工作将集成基于超启发式的DRL和探索合作多智能体强化学习框架。