10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

MiniCPM5-2B开源:AA榜单4B以下第一,端侧模型也能做通用Agent

34分钟前 AI最新动态 0 0

面壁智能与 OpenBMB 社区开源了新一代端侧模型 MiniCPM5-2B。在国际权威基准 Artificial Analysis Intelligence Index 评测中,该模型以 23 分的成绩登顶全球 4B 以下开源基座模型第一,尤其在 Agent 能力上断层领先同级模型。

AA 榜单 4B 以下性能第一

按照 AA Index 最新榜单,MiniCPM5-2B 是全球 4B 参数以下得分最高的开源模型(23 分),高于参数量数倍于己的 Gemma 4 12B(22 分)、Qwen3.5 9B(22 分)和 Qwen3.5 4B(20 分)。

AA 榜单 MiniCPM5-2B 得分

把全部模型按「参数量—得分」放进同一张坐标系,MiniCPM5-2B 站在整条帕累托线的最顶端——两个尺寸(2B 和 1B)各自占住了同级别的性能天花板,印证了面壁智能所坚持的「密度定律」。

参数量—得分坐标系

低 token 消耗,高响应速度

完成同样的 Intelligence Index 任务时,MiniCPM5-2B 平均只消耗 21k 输出 token(推理 14k、回答 7k),处于全场最低一档——而得分相近的 Qwen3.5 9B 需要 34k,Granite 4.2 8B 需要 26k。对端侧部署来说,这意味着更快的响应和更低的推理成本。

Token 消耗对比

Agent 能力断层领先

在 AA Agentic Index 上,MiniCPM5-2B 拿下 20 分——不仅是第二名 Granite 4.2 8B(9 分)的两倍以上,更远超 gpt-oss-20b(3 分)等参数量十倍于己的模型,而多数同级端侧模型仅有 2 分。

Agentic Index 评分对比

在 GDPval-AA v2 榜单上(以人类基线 1000 分为锚点的 Elo 评分),MiniCPM5-2B 拿到 891 分,是所有参评模型中最接近人类水平的一个,领先第二名 Granite 4.2 8B(702 分)近 190 分。

GDPval-AA v2 评分

在「通用智能体」「搜索智能体」「工具调用」「代码推理」等关键维度上均斩获最高分,验证了通用 Agent 能力在高密度端侧模型上的技术可行性。

各维度评测最高分

端侧 Agent 的落地价值

  • 隐私安全:端侧 Agent 可直接读取屏幕内容、调用本地应用,处理设备上的本地数据——这些权限出于安全原因很难完全开放给云端服务。
  • 离线可用与确定性响应:核心推理不依赖网络连接和远程服务,对嵌入操作系统和硬件产品的 Agent(手机、车机、机器人),确定性比绝对速度更重要。
  • 成本优势:本地推理通常不需要按调用次数或 Token 数量持续支付云端 API 费用。对于常驻个人助理、每日自动化流程等长期高频任务,端侧方案有望降低长期使用成本。

MiniCPM 系列模型的开源下载量已突破 5000 万,社区用下载量投的票,往往比跑分更诚实。

高密度端侧模型是怎样炼成的

当参数规模受到端侧设备的硬约束时,底层的数据治理与训练技术栈就成为决定模型上限的关键变量。这次与 MiniCPM5-2B 一同开源了四个数据集:

  • UltraX(预训练):用 0.6B 小模型对网页数据做「行级别」自动编辑,避免大模型端到端改写带来的语义漂移。用 UltraX 修复后的数据训练 1B 模型,160 亿 token 达到了原始数据训 200 亿 token 的效果。
  • UltraData-Code(代码预训练):按 L0–L3 分级治理,从约 1.92 亿个 GitHub 仓库逐级精炼,完成清洗去重、算法代码筛选和任务导向的结构化合成。
  • UltraData-SFT-Agent-2609(SFT):包含 50 多万条 Agent 训练样本,覆盖从基础工具调用到长链路复杂工作流等多样化任务。
  • UltraData-RL-2609(RL 后训练):针对答案不可验证、奖励标签不可信、难度不匹配三大痛点,设计了「可验证性过滤→多模型共识校验→rollout 难度筛选」的三阶段清洗流水线。

自研 RL 框架 Meshy 与 JustRL II 算法

面壁智能随 MiniCPM5-2B 开源了全新的自研强化学习框架 Meshy,去掉了 RL 训练的中央控制器和 Ray 依赖,将训练、推理、奖励计算全部建模到对等服务,能够在同步、异步、全异步三种训练模式中灵活切换。

算法层面,MiniCPM 团队提出基于奖励的强化学习策略 JustRL II:数据上用三阶段流水线筛选校准训练数据,算法上给 GRPO 装上 Critic,实现词元级信用分配。在 JustRL II 加持下,MiniCPM5-2B 在 RL 后训练中获得了显著的性能收益。

JustRL II 算法架构

一本开源账:十个数据集,三年时间线

行业里有个心照不宣的共识:数据管线是各家真正的护城河。绝大多数所谓的「开源模型」,开的其实只是权重。面壁智能这次 MiniCPM5-2B 将模型权重 + 训练 Recipe + 四个训练数据集一并开源,在头部大模型团队里是绝对罕见的做法。

从 2023 年底至今,面壁智能和 OpenBMB 社区累计开源了超过 10 个大模型训练数据集:

  • 2023 年 4 月:UltraChat,约 150 万条合成多轮对话,被全球超过 200 个大模型用于对齐训练。
  • 2023 年 12 月:UltraFeedback,6.4 万条提示词、38 万条 GPT-4 反馈的偏好数据集。
  • 2025 年 12 月:Ultra-FineWeb,约 1T 英文 + 120B 中文 token 的高质量网页预训练语料。
  • 2026 年:UltraData-Math(290B+ token 数学语料)、Ultra-FineWeb-L3(600B token)、UltraX-Preview、Ultra-FineWeb-L1,几乎「按月上新」。

UltraData 系列数据集时间线

截至 2026 年 9 月,UltraData 系列数据集的开源总下载量超过 266 万次。

高质量数据是最厚的地基

当「更大」不再自动等于「更好」,各家比拼的重心正在向数据侧转移。数据治理从不见光的后台工作,变成了决定成败的核心竞争力。一个模型的先进性是有保质期的,几个月后就会被新模型盖过;但一套公开的修复方法、一批高质量的数据集,是别人可以接着往上盖的地基。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:MiniCPM5-2B开源:AA榜单4B以下第一,端侧模型也能做通用Agent
#MiniCPM5 #端侧模型 #Agent #面壁智能 #开源 
收藏 1
GPT-6 Astra上手指南:4步快速上手流程与可复用提示词模板
Agentic UI 设计指南:从任务计划、执行状态到结果工作台
推荐阅读
  • Cherry Studio V2 内测开启:开源 AI 工作台全面升级
  • 腾讯混元多模态实时生图:AI生图已经进化到“毫秒级”,实时生成高精度图像
  • OpenCode 发布大模型调用数据报告:DeepSeek 用量第一,Qwen 缓存命中率 98%
  • 手把手教你白嫖一年Google Gemini Pro,学生免费订阅开通教程
  • Claude Desktop 新增定时任务:本地版 Claude Code,正在把 OpenClaw 的活变得更简单
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
33843 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30346 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23280 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22536 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
20443 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18611 4月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18225 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18204 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
17817 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16391 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 MiniCPM5-2B开源:AA榜单4B以下第一,端侧模型也能做通用Agent
2 OpenAI首席科学家预警:我们正在造出无法理解的外星大脑
3 GPT-6 Astra 单价涨 2.5 倍,编码成本为何持平?实测分析与选型建议
4 豆包开学季福利:大学生认证免费领3个月会员,附使用场景与领取教程
5 GPT-6 Astra 十大玩法:从 SVG 画图到多智能体并行
6 AMD免费API实测:DeepSeek-V4-Flash比英伟达快7.9倍,含opencode和WorkBuddy接入教程
7 微信开放个人虚拟支付:个人开发者也能开通微信支付,10万/月上限下的合规变现路径
8 WorkBuddy 应用市场上线:行业专属工作台+开放生态,要再造一个 AI 版小程序平台
9 谷歌发布 Gemini 2.5 Flash:跑分硬刚 Opus 5,价格仅七分之一的高性价比 AI 模型
10 WorkBuddy 开放平台上线实测:上传第一个 Skill 的完整体验
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联