WayToClawEarn
高影响MOONSHOT OFFICIAL + THIRD-PARTY BENCHMARKS

Kimi K3 开源权重发布:史上最大开源模型是编程专项选手

月之暗面发布 Kimi K3 开源权重——2.8万亿参数编程专项模型,史上最大开源权重发布。Frontend Code Arena 排名第一,76.8% SWE-bench,Modified MIT 许可证。

WayToClawEarn Editorial发布 2026年7月27日

编辑基于公开来源复核 · AI 辅助整理。 内容方法

TL;DR

月之暗面(Moonshot AI)今天正式发布了 Kimi K3 的开源权重——2.8万亿参数的混合专家模型,史上最大的开源权重发布。这不是又一次普通的模型发布。K3 是一个编程专项模型:它在 Frontend Code Arena 上排名第一(超越 Claude Fable 5),SWE-bench Verified 得分 76.8%,在终端基准测试上与前沿模型持平。权重采用 Modified MIT 许可证——意味着允许商业自托管。但现实是:594GB(BF16格式)的下载量意味着你需要多节点 GPU 集群才能运行。对大多数开发者来说,API($3/$15 每百万 token)才是实际路径。真正的故事不是"你能跑吗"——而是开权重编程前沿已经到来,AI 辅助开发的经济账彻底变了。

发生了什么

7月16日,月之暗面通过托管 API 和 kimi.com 上线了 Kimi K3。这个模型立刻引起关注——它在 Frontend Code Arena 上以 1,679 分夺得第一,击败了此前长期占据榜首的 Anthropic Claude Fable 5。今天(7月27日),公司兑现了两周前的承诺:完整模型权重现已公开

这是有史以来最大的开源权重发布。2.8万亿参数(896个专家,每个 token 激活 16 个),K3 的规模远超此前的开源模型。594GB 的下载量(BF16 格式)附带 Modified MIT 许可证——这是一个明确允许商业使用、修改和再分发的宽松许可证。

开发者关心的数字

以下是真正重要的编程性能数据:

基准测试Kimi K3Fable 5GPT-5.6 Sol
Frontend Code Arena#1 (1,679)#2低于 K3
SWE-bench Verified76.8%~75%~73%
Program Bench77.8低于 K3低于 K3
Terminal-Bench 2.188.388.8
SWE Marathon42.0低于 K3

在编程专项基准测试中,K3 在 5 个类别中的 4 个上获胜或追平领先者。它以 Fable 5 约 35% 的成本达到了同等的整体质量。一次实际测试显示,同一个设计提示词,K3 花费 3 美分,Fable 5 花费 38 美分,GPT-5.6 花费 11 美分。

定价同样激进:$3/百万输入 token,$15/百万输出 token,缓存输入低至 $0.30/百万 token。这是 Sonnet 5 级别的定价,却能与 Opus 和 Fable 5 竞争。100万 token 的上下文窗口可以在单个会话中处理整个代码库。

开权重"的现实检验

"开权重"对你的工作流到底意味着什么:

你无法在笔记本上运行它。 2.8万亿参数,即使 4-bit 量化后仍然有大约 1.4TB 的权重。你至少需要 4-8 块 A100/H100 GPU(每块 80GB)跨节点做张量并行。这是 $50,000+ 的硬件投入,或在云 GPU 提供商上大约 $40-80/小时。

你可以在托管推理集群上运行它。 如果你的组织已经在运行 vLLM 或 SGLang 部署,K3 可以作为一个自托管的编程专项模型接入。Modified MIT 许可证意味着没有使用限制——发布商业产品、在专有代码上微调、为国防承包商做气隙部署。这才是真正的价值主张。

对个人和小团队来说,API 才是实际路径。 $3/$15 每百万 token 的定价,你支付的大约是 Claude Sonnet 5 的价格,但获得的是接近 Fable 5 的编程性能。作为对比:DeepSeek V4 和 Kimi K2.6 等开源模型在编程工作负载上比 Claude Opus 4.7 便宜 50-79 倍。K3 处于一个有趣的中位——对企业自托管够开放,对 API 访问够便宜。

这对你的 AI 编程技术栈意味着什么

1. 开权重编程前沿已是现实。 一年前,"开权重"意味着在编程基准上落后 GPT-4 20 分以上的模型。今天,一个开权重模型登顶了 Frontend Code Arena。专有和开源编程能力之间的差距已实质上消除。

2. 企业自托管有了核选项。 如果你的公司有合规要求阻止将代码发送到外部 API(金融、医疗、国防),你现在可以在自己的基础设施上部署前沿级编程模型,使用宽松许可证。不用和 Anthropic 谈合同。数据不离开你的 VPC。

3. 成本杠杆转移到买方。 当开权重领先者匹敌专有模型时,API 定价变成了谈判,而非要么接受要么放弃。月之暗面的 $3/$15 定价削弱了可比的前沿 API。Anthropic 和 OpenAI 将面临调整压力——要么降价,要么提升能力。

4. 真正的瓶颈是硬件,而非模型获取。 K3 的发布证实了一个模式:前沿模型权重正在变得可用,但运行它们的基础设施才是护城河。云 GPU 提供商(Lambda Labs、RunPod、CoreWeave)和推理优化工具(vLLM、SGLang、TensorRT-LLM)是新的守门人。

本周你应该做什么

  • 先试试 API。 在 kimi.com 注册或使用 Kimi API 搭配 OpenAI 兼容客户端。在你实际的编程任务上测试——不要只相信基准测试。
  • 对比你当前的工具体验。 把同样的提示词跑在 K3 和你现在用的工具上(Claude Code、Cursor、Copilot)。衡量输出质量、延迟和每次任务成本。
  • 如果你有 GPU 集群,下载权重。 594GB 的下载量大但可管理。搭建 vLLM 端点并对比现有推理栈做基准测试。
  • 关注社区量化版本。 GGUF 和 AWQ 量化版本将在几天内出现在 Hugging Face 上。这些无法在单 GPU 上运行,但会将门槛从"8 块 H100"降低到"2-4 块消费级显卡"用于实验。

开权重编程前沿已经到来。今天的发布意味着问题不再是"开源模型能编程吗"——而是"哪个模型给你的技术栈带来最佳的成本能力比?" Kimi K3 刚刚拉高了所有人的标准。

kimimoonshotopen-sourcecodingbenchmarkself-hostingmodel-release
免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。