10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

面壁智能 WAIC 发布 MiniCPM-Robot:开源具身智能模型,RMBench 得分 53 分

15小时前 AI最新动态 42 0

让机器人执行「把这个按钮按五下」这样的指令,其实比想象中困难得多。不少 VLA(视觉-语言-动作)模型要么按一下就停,要么停不下来——因为它们根本不记得自己已经按过几次。这个看似不起眼的毛病,背后折射出的是具身智能领域一直未能解决好的核心问题:记忆。

在近日举行的世界人工智能大会(WAIC)上,面壁智能发布了首个具身智能系列模型并开源,包含两个模型:负责操作的 MiniCPM-RobotManip 和负责跟踪导航的 MiniCPM-RobotTrack。

具身智能的记忆门槛

主流的 VLA 模型靠摄像头「看」、语言指令「懂」,然后输出动作。但大多数模型只看「这一帧」——判断下一步时只依据当前画面和指令,不参考之前的观测和动作。如果把历史观测纳入判断,效果会更好,但计算量会成倍增长,许多团队因算力压力只能选择放弃记忆,回到「看一帧、算一步」的做法。

视觉 Token 压缩是关键

面壁智能的 MiniCPM-RobotManip 基于 MiniCPM-V 4.6 多模态大模型训练,核心技术是视觉 Token 极致压缩。在机器人应用场景中,VLA 模型每次推理通常要处理三张摄像头图片加一段文本指令,每秒重复多次。如果能把图片转换成的 Token 数量压低且信息不丢失,计算量就会显著减少,推理速度更快。凭借这一能力,MiniCPM-RobotManip 即使将历史观测数据纳入输入,推理成本仍能追平传统单帧模型。此外采用流式计算方法,让带记忆的推理成本与传统无记忆模型持平。

图片 1

图片 2

跑分数据

在主流 VLA 基准测试中,MiniCPM-RobotManip 的综合性能位列第一梯队,与 Qwen-VLA、π0.5 等主流模型相近甚至更出色。在考验上下文记忆的 RMBench 榜单上,主流 π0.5 模型得分仅 10 分(接近随机水平),而 MiniCPM-RobotManip 达到 53 分。

图片 3

纯本地跟踪:断网也能跟

MiniCPM-RobotTrack 解决的是另一个问题:机器人在没有网络的地方能否正常工作。基于 MiniCPM4-0.5B 模型训练,参数仅 0.9B,无需额外感知模块或外接开发板,仅靠原装摄像头和本地算力就能完成单目标跟踪、动态多目标跟踪和指令模糊跟踪。

评测结果显示,三项细分能力的跟踪成功率分别达到 89.8%、73.4% 和 80.4%,是目前开源方案中的最优结果。

图片 4

工程层面,团队围绕宇树 Go2 机器狗的完整运行链路做了系统级优化,在本地算力上稳定跑到每秒 5 帧以上,端到端响应延迟约 180 毫秒。纯本地部署带来了三方面优势:无需等待网络传输和云端响应、画面和指令不上传云端降低隐私风险、弱网或无网环境下依然正常工作。

配套推理引擎与落地案例

同时发布的推理框架 PhyAI,在 NVIDIA RTX 5090 上对 π0、π0.5、GR00T 等主流模型分别带来 2.9 倍、1.8 倍和 2.3 倍的推理加速。面壁发布的机器人模型在当天即完成适配,推理帧率从 10Hz 提升到 33Hz。

落地方面,面壁与乐聚机器人合作推出展厅导览和园区巡检方案;与吉利汽车联合训练 VLA 模型,通过 RoboHarness 框架将 VLM、VLA、机器人本体和导航系统整合,落地到生产仓储场景。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:面壁智能 WAIC 发布 MiniCPM-Robot:开源具身智能模型,RMBench 得分 53 分
#面壁智能 #具身智能 #MiniCPM #WAIC #机器人 
收藏 1
微信支付 SkillPay 上线:Agent 可付费调用技能,知识付费迎来新模式
Claude HUD:Claude Code 终端状态栏插件,实时监控上下文与Token用量
推荐阅读
  • Step 3.5 Flash 全链路开源,冲上 OpenClaw 调用榜
  • 豆包导航上线:月活3亿+,AI超级入口再下一城
  • 实测国内首个中文 OpenClaw:Molili,上手顺畅,安全策略与可视化都很能打
  • Meta 发布全新大模型 Muse Spark:多模态是强项,编程是短板
  • MiniMax M2.5 发布:国产 Agent 迈入低成本高可用阶段,OpenClaw 之父多次点名推荐
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
32532 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
29136 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
21445 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
21046 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
17210 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
16903 3月前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
16749 1年前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
16745 3月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
16581 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
15625 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 面壁智能 WAIC 发布 MiniCPM-Robot:开源具身智能模型,RMBench 得分 53 分
2 微信支付 SkillPay 上线:Agent 可付费调用技能,知识付费迎来新模式
3 阿里云百炼Token Plan个人版首发体验:40元套餐回归,Qwen3.8-Max-Preview免费加量10倍
4 Kimi K3 深度评测:2.8T 参数开源模型,性能能否媲美旗舰?
5 Qwen-3.8-Max 限时 0.2 折,Kimi K3 下架后的平替方案
6 Kimi K3正式发布:前端能力超越Fable 5,世界顶尖开源模型
7 小红书内测小工具功能:一键上传VibeCoding作品,笔记挂载直接可用
8 Anthropic三位高管对谈Agent终极形态:从聊天进化成看不见的操作系统
9 Grok Build 被曝偷偷上传用户代码仓库,含 SSH 密钥和 API 凭证
10 PP-OCRv6发布:34.5M参数击败235B大模型,50种语言OCR可运行在手机端
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联