核心项目
Selected Projects
EmbodiedBrain:具身智能 VLM 后训练 →
主导落地创新性的 Step-GRPO 算法,解决稀疏奖励问题;训练时间缩短约 20%。32B 模型在 14 项基准测试达 SOTA。
点此查看完整技术细节
5G/6G 智能自适应调制编码 (AI-AMC) →
基于 DQN 实现 MCS 与 RI 的联合动态分配,引入 Reward Shaping 加速收敛,显著提升频谱效率与边缘用户吞吐量。
点此查看完整技术细节
簇间 RB 多智能体联合调度 →
建模为 Dec-POMDP,落地 MAPPO 算法实现 CTDE,将多小区 RB 资源重叠面积全局最小化,显著降低系统级干扰。
点此查看完整技术细节