Kimi K3 是 Moonshot AI 2026 年 7 月发布的前沿模型,以 2.8 万亿参数成为全球首个开放权重的 3T 级模型。7 月 16 日通过托管 API 上线,7 月 27 日发布完整权重和 47 页技术报告。核心定位:可下载、可微调、可自托管的前沿级智能——但在许可和所需硬件上均有限制。
架构为混合专家 transformer,896 个专家中每 token 激活 16 个(104B 激活参数),1M token 上下文窗口,通过 MoonViT-V2 原生支持视觉。Moonshot 声称通过 Kimi Delta Attention (KDA)、Attention Residuals (AttnRes) 和 Stable LatentMoE 三项创新实现了约 2.5 倍于 Kimi K2 的扩展效率。
架构
| 规格 | 值 |
|---|---|
| 总参数 | 2.8T |
| 激活参数 | 104B(每 token 16/896 路由专家) |
| 上下文窗口 | 1M token |
| 视觉 | MoonViT-V2(原生图像理解) |
| API 模型 ID | kimi-k3 |
定价(托管 API)
| 费率 / 1M token | |
|---|---|
| 输入 | $3.00 |
| 缓存输入 | $0.30 |
| 输出 | $15.00 |
许可证
Kimi K3 不是 MIT 或 Apache 2.0。它使用自定义 Kimi K3 License,两个关键条件:
- MaaS 收入门槛:年总收入超 $2000 万的 MaaS 运营商须与 Moonshot AI 签署单独商业协议。
- 品牌展示义务:月活超 1 亿或月收入超 $2000 万的商业产品须在界面突出显示「Kimi K3」。
对大多数个人开发者和中小企业,许可是宽松的。对构建托管推理服务的企业,请仔细阅读仓库中的 LICENSE 文件。
横向对比
- vs Kimi K2.7 Code: K3 是大得多的后继(2.8T vs 1T)。K2.7 Code 专注编码且为 Modified MIT;K3 是通用前沿、许可更严。
- vs GLM-5.2: 同为中国开放权重大 MoE。GLM-5.2(753B, MIT)更小且真正 MIT;K3(2.8T)更大更强,但更难自托管、商业限制更多。
- vs Claude Fable 5 / GPT-5.6 Sol: K3 在最难基准上自称落后于二者,但它是唯一可下载权重的。对能自托管的组织,价值在于控制权和长期成本。
时间线
| 日期 | 事件 |
|---|---|
| 2026 年 7 月 16 日 | 托管 API 上线($3/$15) |
| 2026 年 7 月 27 日 | 完整权重 + 技术报告 + 基础设施代码在 GitHub / Hugging Face 发布 |
适用场景
- 从前沿质量开放权重进行下游蒸馏和微调
- 有算力组织的自托管前沿推理
- 长期智能体编码和知识工作
- 3T 级训练配方和基础设施的研究访问
优缺点
优势
- 最大开放权重前沿模型(2.8T 参数)——超越所有其他开源及大部分闭源模型
- 通过 Kimi Delta Attention 和 Stable LatentMoE 实现约 2.5 倍于 K2 的扩展效率
- 原生视觉(MoonViT-V2)和 1M token 上下文窗口
- 完整权重 + 训练基础设施(注意力内核、MoE 通信库)公开可用
局限
- 需要 64+ 加速卡超级节点——大多数团队无法自行部署
- 自定义 Kimi K3 License,非 MIT/Apache——年收入超 $2000 万的商业 MaaS 运营商需签独立协议
- 在最难基准上仍落后于 Fable 5 和 GPT-5.6 Sol
- 不支持音频/视频输入
常见问题
Kimi K3 什么时候发布的?
Moonshot AI 于 2026 年 7 月 16 日通过托管 API 推出 Kimi K3。完整模型权重、47 页技术报告和基础设施代码于 2026 年 7 月 27 日在 Hugging Face 和 GitHub 上发布。
Kimi K3 是真正的开源吗?
开放权重,但按 OSI 定义不是开源。权重以自定义「Kimi K3 License」发布,允许大多数开发者免费使用,但年总收入超 $2000 万的 MaaS 运营商需签独立商业协议,月活超 1 亿或月收入超 $2000 万的商业产品须在界面突出展示 Kimi K3 品牌。请直接阅读 GitHub 上的 LICENSE 文件。
Kimi K3 有多大?
混合专家配置中共 2.8 万亿参数,896 个专家中每 token 激活 16 个,实际激活 1040 亿参数。使用 Kimi Delta Attention (KDA)、Attention Residuals (AttnRes) 和 Stable LatentMoE。
运行 Kimi K3 需要什么硬件?
Moonshot 建议 64+ 加速卡超级节点配置。支持的推理引擎包括 vLLM、SGLang 和 TokenSpeed。权重以原生量化方式发布(从 SFT 阶段开始的量化感知训练)。