← 返回项目列表

项目背景

在复杂动态变化的无线信道环境下,传统基于静态查表的 AMC 机制难以实现最优的频谱效率, 且容易面临信道快变导致的调度滞后问题。本项目用强化学习替代查表,实现链路自适应 (Link Adaptation) 的智能决策。

核心算法(强化学习 & DQN)

  • 设计并落地了基于 DQN 的智能调度算法,取代传统启发式规则。
  • 实现了调制编码策略 (MCS)秩指示 (RI) 的联合动态分配。
  • 将历史信道质量指示 (CQI)、信噪比 (SNR) 等通信指标抽象为状态空间,使智能体能够精准预测并输出最优策略。

模型调优与工程落地

  • Reward Shaping:为加速 DQN 在复杂状态空间下的收敛,引入了对数变换的奖励塑形机制,有效解决了强化学习中常见的奖励稀疏与抖动问题。
  • Q-value 可视化:开发自动化脚本绘制 Q-value 热力图,直观监控模型在不同信道特征下的动作价值分布,指导探索策略的快速迭代。

业务收益

  • 算法有效适应了快衰落信道
  • 在保障底层通信链路可靠性(控制目标误块率)的前提下,显著提升系统的整体频谱效率和边缘用户的吞吐量。