Kimi K3 模型权重正式开源,参数量达到 2.8 万亿,实际激活参数 1040 亿,支持 100 万 token 上下文窗口,同时具备原生视觉理解能力。这是目前公开的首个 3 万亿参数级别的开源模型。
核心结论:Kimi K3 在综合能力上仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但已全面超越 Claude Opus 4.8、GPT-5.5 和 GLM-5.2。整篇技术报告未透露视觉编码器的训练 token 数量和算力消耗。

技术报告:GitHub 链接

架构上做了什么
Kimi K3 的核心改动集中在三个维度:长序列处理、深层网络的信息利用、以及专家网络的高效调用。
注意力机制:Kimi Delta Attention
K3 采用了一种称为 Kimi Delta Attention(KDA)的线性注意力方法。每个模块内 3 层 KDA 搭配 1 层传统的全局注意力(Gated MLA),兼顾超长序列处理和全局信息保留。此次 K3 的 MLA 也改为无位置编码(NoPE)版本,位置信息完全依靠 KDA 的门控衰减机制隐式传递。这可能是首次将线性注意力与 NoPE 结合的混合架构——此前同类模型的全局注意力层通常保留 RoPE。团队还改进了 KDA 的衰减机制,用有下界的设计替换了可能数值溢出的旧方案,使计算可以完全用张量核心加速。
Attention Residuals:跨层信息回看
Attention Residuals 让每一层网络除了接收上一层输出外,还能有选择性地回看更早层的信息,而非像传统残差连接那样将历史信息压缩后单向传递。为控制开销,团队将 93 层网络分为 8 个块,仅在块与块之间做全量跨层注意力,显著降低计算和显存成本。
混合专家网络(MoE)稳定性
K3 将专家数量从 K2 的 384 个扩展到 896 个,每个 token 激活的专家数从 8 个提升到 16 个,稀疏度从 48 倍提高到 56 倍。专家增多带来了两个挑战:数值爆炸和负载不均衡。团队为此设计了新激活函数 SiTU-GLU 来限制数值幅度,并提出 Quantile Balancing(QB)负载均衡算法。QB 延续 DeepSeek 思路,不做带偏置的加权而是归一化处理,同时用上一批次数据估计当前批次的专家阈值,保证训练因果性。
训练效率提升 2.5 倍
综合架构改动和训练方法优化,K3 相对 K2 整体训练效率提升约 2.5 倍。训练上下文长度从 K2 的 128K 提升到 100 万 token,通过四阶段课程学习逐步扩展窗口,配合专门合成的超长文本训练数据防止模型在长序列上退化。
后训练流程
K3 的后训练分为三步:
- 监督微调:使用高质量复杂智能体轨迹数据打底
- 强化学习:分别在通用任务、通用智能体、编程智能体三大类上训练,每类再细分三档推理强度,训练出九个专家模型
- 多教师同策略蒸馏:将九个专家模型能力合并进统一模型
强化学习方面,K3 延续 co-located 协同部署架构,可将百万 token 级别的 RL 实验控制在几百张 GPU 规模内。任务生成机制包括:知识图谱驱动的题目自动生成系统、覆盖 CUDA/Triton 等多种编程方式的题库,以及模拟真实办公软件的长周期助理任务环境(单次任务可能涉及上千次工具调用)。
部署成本优化方面,K3 从后训练阶段就使用 MXFP4 低精度格式训练专家权重,训练和推理采用同一套量化方案。
基础设施
支撑 2.8 万亿参数训练和百万 token 强化学习,团队做了多项基础设施优化:
- 为 KDA 开发专用融合内核 FlashKDA
- 设计跨设备上下文并行方案,解决超长序列切分时的状态依赖问题
- MoonEP 专家并行方案:通过动态调度冗余专家,使每张卡处理的 token 数量严格相等,消除负载不均衡带来的显存碎片和吞吐损失
MoonEP 与 DeepSeek 的 DeepEP v2 对比测试显示,MoonEP 的通信耗时几乎不受负载不均衡程度影响,而 DeepEP v2 会随不均衡加剧持续变慢,甚至在高不均衡场景下训练崩溃。MoonEP 则始终保持稳定,目前除支持 NVIDIA GPU 外,还在适配阿里真武 PPU 国产芯片。

真武系列 AI 芯片是阿里巴巴旗下平头哥半导体自研的 AI 芯片系列,定位为覆盖从 AI 模型训练到推理的全场景 AI 算力需求。该系列已发布真武 810E 和真武 M890 型号。
配套发布:PerceptionBench
团队同步发布了 PerceptionBench 视觉感知评测基准,从 42 个现有基准中模型出错的案例反推出 10 种最基础感知能力(计数、深度、定位、细粒度识别、幻觉等),构造了 3000 道每题只考察单一能力的题目。测试显示 16 个主流多模态模型无一准确率超过 60%,感知类幻觉是所有模型平均表现最差的一项。该基准已开源。

实测案例
GPU 内核优化任务中,K3 把一个注意力残差内核的延迟从 283.6 毫秒降到 114.4 毫秒,表现与 Claude Fable 5 持平。K3 还独立开发了类 Triton 编译器 MiniTriton,以及一个推理芯片原型设计(48 小时内完成,每秒 8700 token 解码吞吐,代码已开源)。
开源协议
K3 开源协议附带商用条件:作为模型即服务业务且年收入超过 2000 万美元需单独授权;产品月活超过 1 亿或月收入超过 2000 万美元需在界面展示 Kimi K3 字样。
模型地址:HuggingFace