10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

Kimi K3 开源:2.8 万亿参数 MoE 架构,100 万 token 上下文,训练效率提升 2.5 倍

50分钟前 AI最新动态 0 0

Kimi K3 模型权重正式开源,参数量达到 2.8 万亿,实际激活参数 1040 亿,支持 100 万 token 上下文窗口,同时具备原生视觉理解能力。这是目前公开的首个 3 万亿参数级别的开源模型。

核心结论:Kimi K3 在综合能力上仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但已全面超越 Claude Opus 4.8、GPT-5.5 和 GLM-5.2。整篇技术报告未透露视觉编码器的训练 token 数量和算力消耗。

Kimi K3 模型对比图

技术报告:GitHub 链接

Kimi K3 技术报告截图

架构上做了什么

Kimi K3 的核心改动集中在三个维度:长序列处理、深层网络的信息利用、以及专家网络的高效调用。

注意力机制:Kimi Delta Attention

K3 采用了一种称为 Kimi Delta Attention(KDA)的线性注意力方法。每个模块内 3 层 KDA 搭配 1 层传统的全局注意力(Gated MLA),兼顾超长序列处理和全局信息保留。此次 K3 的 MLA 也改为无位置编码(NoPE)版本,位置信息完全依靠 KDA 的门控衰减机制隐式传递。这可能是首次将线性注意力与 NoPE 结合的混合架构——此前同类模型的全局注意力层通常保留 RoPE。团队还改进了 KDA 的衰减机制,用有下界的设计替换了可能数值溢出的旧方案,使计算可以完全用张量核心加速。

Attention Residuals:跨层信息回看

Attention Residuals 让每一层网络除了接收上一层输出外,还能有选择性地回看更早层的信息,而非像传统残差连接那样将历史信息压缩后单向传递。为控制开销,团队将 93 层网络分为 8 个块,仅在块与块之间做全量跨层注意力,显著降低计算和显存成本。

混合专家网络(MoE)稳定性

K3 将专家数量从 K2 的 384 个扩展到 896 个,每个 token 激活的专家数从 8 个提升到 16 个,稀疏度从 48 倍提高到 56 倍。专家增多带来了两个挑战:数值爆炸和负载不均衡。团队为此设计了新激活函数 SiTU-GLU 来限制数值幅度,并提出 Quantile Balancing(QB)负载均衡算法。QB 延续 DeepSeek 思路,不做带偏置的加权而是归一化处理,同时用上一批次数据估计当前批次的专家阈值,保证训练因果性。

训练效率提升 2.5 倍

综合架构改动和训练方法优化,K3 相对 K2 整体训练效率提升约 2.5 倍。训练上下文长度从 K2 的 128K 提升到 100 万 token,通过四阶段课程学习逐步扩展窗口,配合专门合成的超长文本训练数据防止模型在长序列上退化。

后训练流程

K3 的后训练分为三步:

  • 监督微调:使用高质量复杂智能体轨迹数据打底
  • 强化学习:分别在通用任务、通用智能体、编程智能体三大类上训练,每类再细分三档推理强度,训练出九个专家模型
  • 多教师同策略蒸馏:将九个专家模型能力合并进统一模型

强化学习方面,K3 延续 co-located 协同部署架构,可将百万 token 级别的 RL 实验控制在几百张 GPU 规模内。任务生成机制包括:知识图谱驱动的题目自动生成系统、覆盖 CUDA/Triton 等多种编程方式的题库,以及模拟真实办公软件的长周期助理任务环境(单次任务可能涉及上千次工具调用)。

部署成本优化方面,K3 从后训练阶段就使用 MXFP4 低精度格式训练专家权重,训练和推理采用同一套量化方案。

基础设施

支撑 2.8 万亿参数训练和百万 token 强化学习,团队做了多项基础设施优化:

  • 为 KDA 开发专用融合内核 FlashKDA
  • 设计跨设备上下文并行方案,解决超长序列切分时的状态依赖问题
  • MoonEP 专家并行方案:通过动态调度冗余专家,使每张卡处理的 token 数量严格相等,消除负载不均衡带来的显存碎片和吞吐损失

MoonEP 与 DeepSeek 的 DeepEP v2 对比测试显示,MoonEP 的通信耗时几乎不受负载不均衡程度影响,而 DeepEP v2 会随不均衡加剧持续变慢,甚至在高不均衡场景下训练崩溃。MoonEP 则始终保持稳定,目前除支持 NVIDIA GPU 外,还在适配阿里真武 PPU 国产芯片。

真武 PPU 芯片介绍

真武系列 AI 芯片是阿里巴巴旗下平头哥半导体自研的 AI 芯片系列,定位为覆盖从 AI 模型训练到推理的全场景 AI 算力需求。该系列已发布真武 810E 和真武 M890 型号。

配套发布:PerceptionBench

团队同步发布了 PerceptionBench 视觉感知评测基准,从 42 个现有基准中模型出错的案例反推出 10 种最基础感知能力(计数、深度、定位、细粒度识别、幻觉等),构造了 3000 道每题只考察单一能力的题目。测试显示 16 个主流多模态模型无一准确率超过 60%,感知类幻觉是所有模型平均表现最差的一项。该基准已开源。

PerceptionBench 基准

实测案例

GPU 内核优化任务中,K3 把一个注意力残差内核的延迟从 283.6 毫秒降到 114.4 毫秒,表现与 Claude Fable 5 持平。K3 还独立开发了类 Triton 编译器 MiniTriton,以及一个推理芯片原型设计(48 小时内完成,每秒 8700 token 解码吞吐,代码已开源)。

开源协议

K3 开源协议附带商用条件:作为模型即服务业务且年收入超过 2000 万美元需单独授权;产品月活超过 1 亿或月收入超过 2000 万美元需在界面展示 Kimi K3 字样。

模型地址:HuggingFace

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:Kimi K3 开源:2.8 万亿参数 MoE 架构,100 万 token 上下文,训练效率提升 2.5 倍
#Kimi K3 #月之暗面 #MoE #开源模型 #大语言模型 
收藏 1
用 TRAE Work 搭建科技媒体研究助理:规则+技能+自动化
这是最后一篇
推荐阅读
  • 亚马逊AWS发布旗下AI 编程工具Kiro,限时免费使用 Claude 4,赶紧安装试试!
  • 9B参数就能接近GPT-4o,MiniCPM-o 4.5如何做到"全模态+全双工+端侧运行"的平衡
  • OpenClaw 官方在 X 平台正式宣布:旗下技能市场 ClawHub 推出中国官方镜像站,附中文界面,国内访问不再受限
  • Cursor 限制国内使用 Claude 等模型解决方案!
  • ChatGPT Atlas:AI浏览器时代的开端,Open AI 浏览器正式发布!
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
32770 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
29322 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
21666 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
21328 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
17568 4月前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
17425 1年前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
17254 3月前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
16859 1年前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
16833 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
15757 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 Kimi K3 开源:2.8 万亿参数 MoE 架构,100 万 token 上下文,训练效率提升 2.5 倍
2 千问办公上线速测:钉钉生态打通的独立 AI Agent 办公产品
3 SkillOS:用 RL 训练 8B 小模型管理 Agent 技能库,效果超 Gemini
4 Google Gemini Spark 开放 AI Pro 订阅:20 美元/月的个人 AI 智能体
5 Doubao-Seed-Evolving:支持 1M 上下文、按周迭代的持续进化大模型
6 Macaron-V1:基于 GLM-5.2 的 MoL 架构个人智能体,2M 上下文 + 四大专家 LoRA
7 Qwen-Image-3.0:落字成画,字字如印——千问新一代图像生成模型
8 Google 三款 Gemini Flash 连发:3.6 Flash 主力升级,Agent 成本全面下探
9 OpenAI 模型在安全评测中自主逃逸沙箱,攻击 Hugging Face 生产数据库
10 Google 发布 Gemini 3.6 Flash:输出 Token 成本降 17%,Agent 效率全面升级
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联