← 返回项目列表

项目背景与痛点

现有大模型应用于物理机器人时普遍存在三个行业痛点:

  • 模型设计与物理系统约束脱节:算法在仿真里跑得好,下发到真实机器人就失效。
  • 推理延迟与性能难以平衡:规划任务越长,模型响应越慢,难以满足在线决策需求。
  • 传统离线评测指标无法反映真实物理世界复杂度:榜单分高不代表能落地。

核心算法研发(后训练 & 强化学习)

参与公司核心具身智能大脑 EmbodiedBrain (7B / 32B) 的研发与后训练全流程,覆盖 SFT、GRPO、DAPO、GSPO 等算法。

主导落地创新性的 Step-GRPO 算法:通过将长序列规划任务拆解,并引入前置步骤作为引导前缀,有效解决了强化学习过程中的稀疏奖励问题,大幅提升模型在长视野复杂任务规划中的成功率。

多模态奖励系统设计

  • 设计并实现了一套综合奖励机制,引入生成式奖励模型 (GRM) 评估模型输出格式的准确性与规划的合理性。
  • 为解决计算瓶颈,在底层架构上实现了异步优化计算机制,将端到端强化学习的训练时间缩短约 20%,且未损耗模型精度。

Agentic 交互学习与在线蒸馏(OPD)

  • 构建高保真沙盒仿真环境并定义多维奖励函数,实现大模型在封闭环境下的自主交互试错(Agentic Training)。
  • 引入 OPD (On-Policy Distillation) 技术:利用教师模型在交互轨迹上的实时指导对学生模型进行在线蒸馏,有效缓解分布偏移问题。

业务收益与产出

  • 训练出的 EmbodiedBrain 模型在通用多模态、空间感知及任务规划等 14 项基准测试中达到 SOTA。
  • 其中 32B 模型在极具挑战的 VLM-PlanSim-99 真实仿真任务中取得 46.46% 的成功率,以近乎翻倍的优势超越同期头部基线模型。
  • 相关论文:EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence,arXiv:2510.20578。

项目主页 →