← 返回项目列表
VLM · Embodied AI
EmbodiedBrain:具身智能视觉语言大模型后训练
2025.03 – 至今 · 中兴通讯 · 大模型算法工程师
项目背景与痛点
现有大模型应用于物理机器人时普遍存在三个行业痛点:
- 模型设计与物理系统约束脱节:算法在仿真里跑得好,下发到真实机器人就失效。
- 推理延迟与性能难以平衡:规划任务越长,模型响应越慢,难以满足在线决策需求。
- 传统离线评测指标无法反映真实物理世界复杂度:榜单分高不代表能落地。
核心算法研发(后训练 & 强化学习)
参与公司核心具身智能大脑 EmbodiedBrain (7B / 32B) 的研发与后训练全流程,覆盖 SFT、GRPO、DAPO、GSPO 等算法。
主导落地创新性的 Step-GRPO 算法:通过将长序列规划任务拆解,并引入前置步骤作为引导前缀,有效解决了强化学习过程中的稀疏奖励问题,大幅提升模型在长视野复杂任务规划中的成功率。
多模态奖励系统设计
- 设计并实现了一套综合奖励机制,引入生成式奖励模型 (GRM) 评估模型输出格式的准确性与规划的合理性。
- 为解决计算瓶颈,在底层架构上实现了异步优化计算机制,将端到端强化学习的训练时间缩短约 20%,且未损耗模型精度。
Agentic 交互学习与在线蒸馏(OPD)
- 构建高保真沙盒仿真环境并定义多维奖励函数,实现大模型在封闭环境下的自主交互试错(Agentic Training)。
- 引入 OPD (On-Policy Distillation) 技术:利用教师模型在交互轨迹上的实时指导对学生模型进行在线蒸馏,有效缓解分布偏移问题。
业务收益与产出
- 训练出的 EmbodiedBrain 模型在通用多模态、空间感知及任务规划等 14 项基准测试中达到 SOTA。
- 其中 32B 模型在极具挑战的 VLM-PlanSim-99 真实仿真任务中取得 46.46% 的成功率,以近乎翻倍的优势超越同期头部基线模型。
- 相关论文:EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence,arXiv:2510.20578。