← 返回项目列表

项目背景与痛点

5G/6G 组网环境下,多个相邻小区需在固定 273 个 RB(资源块)构成的频谱空间内进行高频次资源抢占。 由于环境的局部可观测性(当前小区仅掌握自身实时需求及周边小区历史调度序列), 传统独立调度极易导致物理资源重叠与严重的簇间同频干扰。

核心算法(MAPPO & 多智能体协同)

  • 将该资源分配问题建模为去中心化部分可观测马尔可夫决策过程 (Dec-POMDP)
  • 主导落地了基于 MAPPO (Multi-Agent PPO) 的多智能体联合学习算法,实现多个小区基站的集中式训练与去中心化执行 (CTDE)
  • 完成了从单点局部决策到多智能体协同演进的跨越。

特征工程与状态空间设计

  • 深度定制智能体网络输入,精准融合了小区间干扰矩阵、周边小区历史 RB 调度数量、以及本小区实时 RB 需求。
  • 通过中心化 Critic 网络评估全局交叉干扰状态,指导 Actor 网络输出最优的 RB 起始位置与连续分配策略。

业务收益

  • 算法有效打破了小区间的信息孤岛与博弈困境
  • 在保障各小区实时容量需求的前提下,实现了多小区 RB 资源重叠面积的全局最小化
  • 显著降低了系统级干扰,并提升了边缘用户体验。