Kimi K3:开源 3T 参数模型
7 月 27 日,月之暗面(Moonshot AI)在 HuggingFace 上发布了 Kimi K3 的模型权重。这是全球首个开放的 3T 参数级大模型。
Kimi K3 有 2.8 万亿参数,采用混合专家(MoE)架构——896 个专家中每次激活 16 个。上下文窗口 100 万 token,原生支持图片和视频理解。模型权重在 HuggingFace 上可下载,许可证为开放权重许可。
架构
Kimi K3 用了几项新的架构设计。Kimi Delta Attention(KDA)改善了长序列下的注意力计算效率。Attention Residuals(AttnRes)让信息跨层流动更灵活,而非逐层累积。Stable LatentMoE 框架处理专家路由,用分位数平衡(Quantile Balancing)替代了传统的启发式方法。
模型从 SFT 阶段就开始量化感知训练,使用 MXFP4 权重 + MXFP8 激活值。月之暗面表示这能让模型在更广泛的硬件上运行。
性能表现
官方公布了一些基准测试数据:
DeepSWE v1.1:Kimi K3 得分 67.3(mini-SWE-agent 评估工具)。
SWE Marathon:Kimi K3 与 Claude Opus 4.8、Claude Fable 5 一起用 Claude Code 评估,GPT-5.6 Sol 用 Codex 评估。官方提到 Claude Fable 5 在 35% 的任务上触发了 fallback 机制,可能影响其得分。
GPU 内核优化:各模型在沙箱中独立工作 24 小时,优化四个 GPU 内核任务。Kimi K3 与 Fable 5(含 fallback)接近,明显优于 Opus 4.8、GPT-5.6 Sol 和 GPT 5.5。
月之暗面自己的评价是:Kimi K3 的整体性能仍落后于最强闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但在其评测套件中持续超越其他测试模型。
一个值得注意的成果:K3 的一个早期版本在开发后期承担了团队大部分 GPU 内核优化工作。它还从零构建了 MiniTriton——一个类 Triton 编译器,在某些负载上性能超过了 Triton 和 torch.compile。
价格与可用性
Kimi K3 的定价:缓存命中输入 $0.30/百万 token,缓存未命中输入 $3.00/百万 token,输出 $15.00/百万 token。
K3 可通过 Kimi.com、Kimi Work 桌面应用、Kimi Code(终端/IDE)和 Kimi API 使用。移动端支持 iOS、Android 和 HarmonyOS。
开源生态影响
Kimi K3 是开源大模型的一个新里程碑。过去 12 个月中,月之暗面有 9 个月都在刷新开源模型的规模上限。
不过,运行门槛也很高。K3 使用 MXFP4 格式,仍需要约 1.5TB 显存来托管(8 块 B200 的极限),个人开发者基本跑不起来。实际使用预计会通过云服务商和推理合作伙伴提供。
技术报告和更多架构细节将在后续发布。




