← 返回项目列表
Multi-Agent RL
簇间 RB 资源多智能体联合调度与干扰协调
2025.06 – 2026.06 · 中兴通讯 · AI 算法工程师
项目背景与痛点
5G/6G 组网环境下,多个相邻小区需在固定 273 个 RB(资源块)构成的频谱空间内进行高频次资源抢占。 由于环境的局部可观测性(当前小区仅掌握自身实时需求及周边小区历史调度序列), 传统独立调度极易导致物理资源重叠与严重的簇间同频干扰。
核心算法(MAPPO & 多智能体协同)
- 将该资源分配问题建模为去中心化部分可观测马尔可夫决策过程 (Dec-POMDP)。
- 主导落地了基于 MAPPO (Multi-Agent PPO) 的多智能体联合学习算法,实现多个小区基站的集中式训练与去中心化执行 (CTDE)。
- 完成了从单点局部决策到多智能体协同演进的跨越。
特征工程与状态空间设计
- 深度定制智能体网络输入,精准融合了小区间干扰矩阵、周边小区历史 RB 调度数量、以及本小区实时 RB 需求。
- 通过中心化 Critic 网络评估全局交叉干扰状态,指导 Actor 网络输出最优的 RB 起始位置与连续分配策略。
业务收益
- 算法有效打破了小区间的信息孤岛与博弈困境。
- 在保障各小区实时容量需求的前提下,实现了多小区 RB 资源重叠面积的全局最小化。
- 显著降低了系统级干扰,并提升了边缘用户体验。