让机器人执行「把这个按钮按五下」这样的指令,其实比想象中困难得多。不少 VLA(视觉-语言-动作)模型要么按一下就停,要么停不下来——因为它们根本不记得自己已经按过几次。这个看似不起眼的毛病,背后折射出的是具身智能领域一直未能解决好的核心问题:记忆。
在近日举行的世界人工智能大会(WAIC)上,面壁智能发布了首个具身智能系列模型并开源,包含两个模型:负责操作的 MiniCPM-RobotManip 和负责跟踪导航的 MiniCPM-RobotTrack。
具身智能的记忆门槛
主流的 VLA 模型靠摄像头「看」、语言指令「懂」,然后输出动作。但大多数模型只看「这一帧」——判断下一步时只依据当前画面和指令,不参考之前的观测和动作。如果把历史观测纳入判断,效果会更好,但计算量会成倍增长,许多团队因算力压力只能选择放弃记忆,回到「看一帧、算一步」的做法。
视觉 Token 压缩是关键
面壁智能的 MiniCPM-RobotManip 基于 MiniCPM-V 4.6 多模态大模型训练,核心技术是视觉 Token 极致压缩。在机器人应用场景中,VLA 模型每次推理通常要处理三张摄像头图片加一段文本指令,每秒重复多次。如果能把图片转换成的 Token 数量压低且信息不丢失,计算量就会显著减少,推理速度更快。凭借这一能力,MiniCPM-RobotManip 即使将历史观测数据纳入输入,推理成本仍能追平传统单帧模型。此外采用流式计算方法,让带记忆的推理成本与传统无记忆模型持平。


跑分数据
在主流 VLA 基准测试中,MiniCPM-RobotManip 的综合性能位列第一梯队,与 Qwen-VLA、π0.5 等主流模型相近甚至更出色。在考验上下文记忆的 RMBench 榜单上,主流 π0.5 模型得分仅 10 分(接近随机水平),而 MiniCPM-RobotManip 达到 53 分。

纯本地跟踪:断网也能跟
MiniCPM-RobotTrack 解决的是另一个问题:机器人在没有网络的地方能否正常工作。基于 MiniCPM4-0.5B 模型训练,参数仅 0.9B,无需额外感知模块或外接开发板,仅靠原装摄像头和本地算力就能完成单目标跟踪、动态多目标跟踪和指令模糊跟踪。
评测结果显示,三项细分能力的跟踪成功率分别达到 89.8%、73.4% 和 80.4%,是目前开源方案中的最优结果。

工程层面,团队围绕宇树 Go2 机器狗的完整运行链路做了系统级优化,在本地算力上稳定跑到每秒 5 帧以上,端到端响应延迟约 180 毫秒。纯本地部署带来了三方面优势:无需等待网络传输和云端响应、画面和指令不上传云端降低隐私风险、弱网或无网环境下依然正常工作。
配套推理引擎与落地案例
同时发布的推理框架 PhyAI,在 NVIDIA RTX 5090 上对 π0、π0.5、GR00T 等主流模型分别带来 2.9 倍、1.8 倍和 2.3 倍的推理加速。面壁发布的机器人模型在当天即完成适配,推理帧率从 10Hz 提升到 33Hz。
落地方面,面壁与乐聚机器人合作推出展厅导览和园区巡检方案;与吉利汽车联合训练 VLA 模型,通过 RoboHarness 框架将 VLM、VLA、机器人本体和导航系统整合,落地到生产仓储场景。