大语言模型

Kimi K3

全球首个开放权重的 3T 级前沿模型——2.8T 参数(104B 激活 MoE),1M 上下文,原生视觉,自定义收入分级许可。

Kimi K3 是 Moonshot AI 2026 年 7 月发布的前沿模型,以 2.8 万亿参数成为全球首个开放权重的 3T 级模型。7 月 16 日通过托管 API 上线,7 月 27 日发布完整权重和 47 页技术报告。核心定位:可下载、可微调、可自托管的前沿级智能——但在许可和所需硬件上均有限制。

架构为混合专家 transformer,896 个专家中每 token 激活 16 个(104B 激活参数),1M token 上下文窗口,通过 MoonViT-V2 原生支持视觉。Moonshot 声称通过 Kimi Delta Attention (KDA)、Attention Residuals (AttnRes) 和 Stable LatentMoE 三项创新实现了约 2.5 倍于 Kimi K2 的扩展效率。

架构

规格
总参数2.8T
激活参数104B(每 token 16/896 路由专家)
上下文窗口1M token
视觉MoonViT-V2(原生图像理解)
API 模型 IDkimi-k3

定价(托管 API)

费率 / 1M token
输入$3.00
缓存输入$0.30
输出$15.00

许可证

Kimi K3 不是 MIT 或 Apache 2.0。它使用自定义 Kimi K3 License,两个关键条件:

  1. MaaS 收入门槛:年总收入超 $2000 万的 MaaS 运营商须与 Moonshot AI 签署单独商业协议。
  2. 品牌展示义务:月活超 1 亿或月收入超 $2000 万的商业产品须在界面突出显示「Kimi K3」。

对大多数个人开发者和中小企业,许可是宽松的。对构建托管推理服务的企业,请仔细阅读仓库中的 LICENSE 文件。

横向对比

  • vs Kimi K2.7 Code K3 是大得多的后继(2.8T vs 1T)。K2.7 Code 专注编码且为 Modified MIT;K3 是通用前沿、许可更严。
  • vs GLM-5.2 同为中国开放权重大 MoE。GLM-5.2(753B, MIT)更小且真正 MIT;K3(2.8T)更大更强,但更难自托管、商业限制更多。
  • vs Claude Fable 5 / GPT-5.6 Sol K3 在最难基准上自称落后于二者,但它是唯一可下载权重的。对能自托管的组织,价值在于控制权和长期成本。

时间线

日期事件
2026 年 7 月 16 日托管 API 上线($3/$15)
2026 年 7 月 27 日完整权重 + 技术报告 + 基础设施代码在 GitHub / Hugging Face 发布

适用场景

  • 从前沿质量开放权重进行下游蒸馏和微调
  • 有算力组织的自托管前沿推理
  • 长期智能体编码和知识工作
  • 3T 级训练配方和基础设施的研究访问

优缺点

优势

  • 最大开放权重前沿模型(2.8T 参数)——超越所有其他开源及大部分闭源模型
  • 通过 Kimi Delta Attention 和 Stable LatentMoE 实现约 2.5 倍于 K2 的扩展效率
  • 原生视觉(MoonViT-V2)和 1M token 上下文窗口
  • 完整权重 + 训练基础设施(注意力内核、MoE 通信库)公开可用

局限

  • 需要 64+ 加速卡超级节点——大多数团队无法自行部署
  • 自定义 Kimi K3 License,非 MIT/Apache——年收入超 $2000 万的商业 MaaS 运营商需签独立协议
  • 在最难基准上仍落后于 Fable 5 和 GPT-5.6 Sol
  • 不支持音频/视频输入

常见问题

Kimi K3 什么时候发布的?

Moonshot AI 于 2026 年 7 月 16 日通过托管 API 推出 Kimi K3。完整模型权重、47 页技术报告和基础设施代码于 2026 年 7 月 27 日在 Hugging Face 和 GitHub 上发布。

Kimi K3 是真正的开源吗?

开放权重,但按 OSI 定义不是开源。权重以自定义「Kimi K3 License」发布,允许大多数开发者免费使用,但年总收入超 $2000 万的 MaaS 运营商需签独立商业协议,月活超 1 亿或月收入超 $2000 万的商业产品须在界面突出展示 Kimi K3 品牌。请直接阅读 GitHub 上的 LICENSE 文件。

Kimi K3 有多大?

混合专家配置中共 2.8 万亿参数,896 个专家中每 token 激活 16 个,实际激活 1040 亿参数。使用 Kimi Delta Attention (KDA)、Attention Residuals (AttnRes) 和 Stable LatentMoE。

运行 Kimi K3 需要什么硬件?

Moonshot 建议 64+ 加速卡超级节点配置。支持的推理引擎包括 vLLM、SGLang 和 TokenSpeed。权重以原生量化方式发布(从 SFT 阶段开始的量化感知训练)。

来源

最后更新:2026-07-29 · 规格与价格变动很快——使用前请在厂商官网核实。