个人简介
电子科技大学计算机科学与工程硕士(2023 年毕业)、约翰霍普金斯大学电气与计算机工程硕士(2021 年)。 2023 年加入中兴通讯蓝剑计划,现任 AI 算法工程师,研究方向覆盖深度学习、强化学习、大语言模型预训练/后训练,以及具身智能(VLM/VLA)。
About
电子科技大学计算机科学与工程硕士(2023 年毕业)、约翰霍普金斯大学电气与计算机工程硕士(2021 年)。 2023 年加入中兴通讯蓝剑计划,现任 AI 算法工程师,研究方向覆盖深度学习、强化学习、大语言模型预训练/后训练,以及具身智能(VLM/VLA)。
Experience
蓝剑计划 · 系统部
Selected Projects · 点此查看全部
参与 7B / 32B 模型研发与后训练全流程(SFT、GRPO、DAPO、GSPO)。 主导落地 Step-GRPO,通过拆解长序列任务并引入前置步骤前缀,解决稀疏奖励问题。
设计生成式奖励模型(GRM)与异步优化机制,端到端训练时间缩短约 20%。
32B 模型在 14 项基准测试达 SOTA,其中 VLM-PlanSim-99 取得 46.46% 成功率。
设计基于 DQN 的智能调度算法,联合优化 MCS 与 RI。 引入对数变换的 Reward Shaping 解决奖励稀疏与抖动;通过 Q-value 热力图辅助迭代。
在保障误块率的前提下显著提升频谱效率与边缘用户吞吐量。
将 RB 资源分配建模为 Dec-POMDP,主导落地 MAPPO 多智能体联合学习算法,实现 CTDE。
中心化 Critic 评估全局干扰,指导 Actor 输出最优 RB 起始位置与连续分配策略,全局最小化多小区 RB 重叠面积。
Publications · 谷歌学术引用 300+
Awards & Skills
PMP · 项目管理专业人士
普通话(母语)、英语(IELTS 7.5、CET-4、CET-6)
魔术、羽毛球、乒乓球
Contact · 提交留言会保存到 D1 数据库
留言会保存到 Cloudflare D1 数据库,是这个项目 P3 阶段的学习成果。
在职 · 欢迎技术交流与合作邀请
深圳