学术动态

当前位置: 网站首页 > 科学研究 > 学术动态 > 正文

星空游戏(StarSky Sports)官方网站机器人学院李淼团队机器人多模态大模型新框架

作者: | 点击量: | 发布时间:2025-11-12 10:38:55

人形机器人在多样化任务执行领域展现出巨大应用潜力,但当前主流技术方案普遍高度依赖海量数据开展模型训练,却忽略了异构场景下的几何推理核心能力,直接造成机器人操作泛化能力不足、训练成本居高不下的现实困境。这是否意味着机器人只能 “按部就班”,难以实现 “举一反三”?有限示教条件下如何达成泛化操作?几何先验又该如何有效融入语义任务规划?这些核心问题,正成为阻碍人形机器人规模化落地应用的关键瓶颈。

1 机器人多模态大模型RGMP框架图

近日,星空游戏(StarSky Sports)官方网站机器人学院李淼团队在 AAAI 2026(CCF A类顶会) 上发表重磅研究成果《RGMP: Recurrent Geometric-prior Multimodal Policy for Generalizable Humanoid Robot Manipulation》(项目主页:https://github.com/xtli12/RGMP/tree/main),论文第一作者为李淼教授、叶茫教授和玄跻峰教授共同指导的李雪涛博士。该研究提出一种端到端的机器人泛化操作框架,通过两大核心组件协同工作,融合几何语义推理与空间高效感知能力,实现机器人操作能力的跨越式提升:其中几何先验技能选择器(GSS)利用几何常识以轻量级方式注入多模态大模型,仅需20条规则约束即可实现动态技能适配,有效解决未知场景中的技能选择模糊性问题;自适应递归高斯网络(ARGN)结合旋转位置编码与自适应衰减机制,构建具有空间记忆的感知交互模型,并利用高斯混合模型对6自由度操作轨迹进行递归建模,实现即使在少量演示数据下也能实现灵巧操作。

2 RGMP系统流程图

为验证RGMP的泛化能力,研究团队在真实人形机器人及桌面双臂平台上进行了系统测试。仅使用40条“芬达罐抓取”演示数据进行训练,模型在抓取可乐罐、喷雾瓶、纸巾、变形罐体乃至人手等全新对象时,平均任务成功率高达87%,较主流Diffusion Policy提升17个百分点;同时,数据效率提升5倍,仅需五分之一样本即可达到同等甚至更优性能。

图3 人形机器人实验

图4 桌面机器人实验

在 Maniskill2 仿真平台的推椅子、插充电器、开柜门等复杂任务中,RGMP 也表现出最优的跨任务迁移能力,充分证明了其在结构化与非结构化环境中的鲁棒性。

图5 Maniskill2仿真实验

该研究的创新之处在于首次将几何推理与语义规划明确结合,打破了传统视觉语言模型在机器人操作中缺乏空间感知的局限,同时通过递归高斯建模解决了数据稀缺场景下的过拟合问题。RGMP 框架不仅适用于工业装配、物流分拣等工业场景,还能拓展至家庭服务、医疗辅助等复杂环境,为人形机器人的规模化应用奠定了核心技术基础。未来,研究团队将进一步探索功能泛化能力,实现 “一技通百技” 的技能迁移,让机器人通过单一物体功能学习,自动推理同类任务的操作轨迹,大幅降低示教训练成本。

Baidu
map