10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

Kimi K3 开源:2.8 万亿参数 MoE 架构,100 万 token 上下文,训练效率提升 2.5 倍

1月前 AI最新动态 519 0

Kimi K3 模型权重正式开源,参数量达到 2.8 万亿,实际激活参数 1040 亿,支持 100 万 token 上下文窗口,同时具备原生视觉理解能力。这是目前公开的首个 3 万亿参数级别的开源模型。

核心结论:Kimi K3 在综合能力上仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但已全面超越 Claude Opus 4.8、GPT-5.5 和 GLM-5.2。整篇技术报告未透露视觉编码器的训练 token 数量和算力消耗。

Kimi K3 模型对比图

技术报告:GitHub 链接

Kimi K3 技术报告截图

架构上做了什么

Kimi K3 的核心改动集中在三个维度:长序列处理、深层网络的信息利用、以及专家网络的高效调用。

注意力机制:Kimi Delta Attention

K3 采用了一种称为 Kimi Delta Attention(KDA)的线性注意力方法。每个模块内 3 层 KDA 搭配 1 层传统的全局注意力(Gated MLA),兼顾超长序列处理和全局信息保留。此次 K3 的 MLA 也改为无位置编码(NoPE)版本,位置信息完全依靠 KDA 的门控衰减机制隐式传递。这可能是首次将线性注意力与 NoPE 结合的混合架构——此前同类模型的全局注意力层通常保留 RoPE。团队还改进了 KDA 的衰减机制,用有下界的设计替换了可能数值溢出的旧方案,使计算可以完全用张量核心加速。

Attention Residuals:跨层信息回看

Attention Residuals 让每一层网络除了接收上一层输出外,还能有选择性地回看更早层的信息,而非像传统残差连接那样将历史信息压缩后单向传递。为控制开销,团队将 93 层网络分为 8 个块,仅在块与块之间做全量跨层注意力,显著降低计算和显存成本。

混合专家网络(MoE)稳定性

K3 将专家数量从 K2 的 384 个扩展到 896 个,每个 token 激活的专家数从 8 个提升到 16 个,稀疏度从 48 倍提高到 56 倍。专家增多带来了两个挑战:数值爆炸和负载不均衡。团队为此设计了新激活函数 SiTU-GLU 来限制数值幅度,并提出 Quantile Balancing(QB)负载均衡算法。QB 延续 DeepSeek 思路,不做带偏置的加权而是归一化处理,同时用上一批次数据估计当前批次的专家阈值,保证训练因果性。

训练效率提升 2.5 倍

综合架构改动和训练方法优化,K3 相对 K2 整体训练效率提升约 2.5 倍。训练上下文长度从 K2 的 128K 提升到 100 万 token,通过四阶段课程学习逐步扩展窗口,配合专门合成的超长文本训练数据防止模型在长序列上退化。

后训练流程

K3 的后训练分为三步:

  • 监督微调:使用高质量复杂智能体轨迹数据打底
  • 强化学习:分别在通用任务、通用智能体、编程智能体三大类上训练,每类再细分三档推理强度,训练出九个专家模型
  • 多教师同策略蒸馏:将九个专家模型能力合并进统一模型

强化学习方面,K3 延续 co-located 协同部署架构,可将百万 token 级别的 RL 实验控制在几百张 GPU 规模内。任务生成机制包括:知识图谱驱动的题目自动生成系统、覆盖 CUDA/Triton 等多种编程方式的题库,以及模拟真实办公软件的长周期助理任务环境(单次任务可能涉及上千次工具调用)。

部署成本优化方面,K3 从后训练阶段就使用 MXFP4 低精度格式训练专家权重,训练和推理采用同一套量化方案。

基础设施

支撑 2.8 万亿参数训练和百万 token 强化学习,团队做了多项基础设施优化:

  • 为 KDA 开发专用融合内核 FlashKDA
  • 设计跨设备上下文并行方案,解决超长序列切分时的状态依赖问题
  • MoonEP 专家并行方案:通过动态调度冗余专家,使每张卡处理的 token 数量严格相等,消除负载不均衡带来的显存碎片和吞吐损失

MoonEP 与 DeepSeek 的 DeepEP v2 对比测试显示,MoonEP 的通信耗时几乎不受负载不均衡程度影响,而 DeepEP v2 会随不均衡加剧持续变慢,甚至在高不均衡场景下训练崩溃。MoonEP 则始终保持稳定,目前除支持 NVIDIA GPU 外,还在适配阿里真武 PPU 国产芯片。

真武 PPU 芯片介绍

真武系列 AI 芯片是阿里巴巴旗下平头哥半导体自研的 AI 芯片系列,定位为覆盖从 AI 模型训练到推理的全场景 AI 算力需求。该系列已发布真武 810E 和真武 M890 型号。

配套发布:PerceptionBench

团队同步发布了 PerceptionBench 视觉感知评测基准,从 42 个现有基准中模型出错的案例反推出 10 种最基础感知能力(计数、深度、定位、细粒度识别、幻觉等),构造了 3000 道每题只考察单一能力的题目。测试显示 16 个主流多模态模型无一准确率超过 60%,感知类幻觉是所有模型平均表现最差的一项。该基准已开源。

PerceptionBench 基准

实测案例

GPU 内核优化任务中,K3 把一个注意力残差内核的延迟从 283.6 毫秒降到 114.4 毫秒,表现与 Claude Fable 5 持平。K3 还独立开发了类 Triton 编译器 MiniTriton,以及一个推理芯片原型设计(48 小时内完成,每秒 8700 token 解码吞吐,代码已开源)。

开源协议

K3 开源协议附带商用条件:作为模型即服务业务且年收入超过 2000 万美元需单独授权;产品月活超过 1 亿或月收入超过 2000 万美元需在界面展示 Kimi K3 字样。

模型地址:HuggingFace

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:Kimi K3 开源:2.8 万亿参数 MoE 架构,100 万 token 上下文,训练效率提升 2.5 倍
#Kimi K3 #月之暗面 #MoE #开源模型 #大语言模型 
收藏 1
用 TRAE Work 搭建科技媒体研究助理:规则+技能+自动化
MonkeyCode:国产开源 AI 编程平台,云端开发 + 手机编程,每天 3000 万免费 Token
推荐阅读
  • 吴恩达三层反馈循环理论:AI 越聪明人越要往外走,告别无效改 Prompt
  • 腾讯CodeBuddy的 AI 编程 IDE内测,真正适合小白的AI编程工具?
  • 重磅|刚刚,智谱 GLM-5.1 全量开放!编码能力狂飙 28%,Claude Code 和 OpenClaw 手动配置教程
  • Uizard:Autodesigner 2.0 AI生成式辅助UI设计工具,产品经理+UI设计
  • 阿里巴巴通义实验发布全新图像模型:Z-Image(造相),1/3的参数达到商业模型的视觉质量
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
33875 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30417 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23311 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22610 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
20605 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18675 4月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18290 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18237 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
17895 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16425 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 ChatGPT Images 2.5 上线:生图速度提升 4 倍,免费用户可用,支持手绘草图生图
2 OpenAI 用 1 万个 Agent 88 小时求解纳维-斯托克斯方程:千禧年数学难题突破
3 小米 MiMo Desktop 邀测上线:长程 Agent 任务 99% 缓存命中,直连 Blender 和 Figma
4 GPT Image 2.5 上线:生图更快更高清,支持涂鸦参考、标注精修和透明背景
5 MiniCPM5-2B开源:AA榜单4B以下第一,端侧模型也能做通用Agent
6 OpenAI首席科学家预警:我们正在造出无法理解的外星大脑
7 GPT-6 Astra 单价涨 2.5 倍,编码成本为何持平?实测分析与选型建议
8 豆包开学季福利:大学生认证免费领3个月会员,附使用场景与领取教程
9 GPT-6 Astra 十大玩法:从 SVG 画图到多智能体并行
10 AMD免费API实测:DeepSeek-V4-Flash比英伟达快7.9倍,含opencode和WorkBuddy接入教程
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联