StableLearn Logo

搜索内容

News 8 min read

Kimi K3 发布:2.8 万亿参数、100 万上下文,价格只有 Claude Fable 5 三成

Kimi K3 正式发布:2.8 万亿参数、原生多模态、100 万 token 上下文,API 输入 3 美元、输出 15 美元。本文对比 GPT-5.6 Sol 与 Claude Fable 5 的价格、能力和适用场景。

Cover image for Kimi K3 发布:2.8 万亿参数、100 万上下文,价格只有 Claude Fable 5 三成

本文发布于 54 天前,内容可能已过时,请注意甄别。

月之暗面正式发布 Kimi K3。这次最抢眼的不只是 2.8 万亿参数,而是它把原生多模态、100 万 token 上下文和前沿 Agent 能力,压到了 3 美元输入、15 美元输出的 API 价格。

但先把结论说清楚:Kimi 官方承认,K3 的整体表现仍落后于 GPT-5.6 SolClaude Fable 5。它真正有竞争力的地方,是用更低价格进入闭源顶尖模型附近的能力区间,并承诺开放完整权重。

30 秒速览

  • 总参数量:2.8T,约 2.8 万亿参数
  • 架构:MoE,每个 token 激活 896 个专家中的 16 个
  • 上下文长度:100 万 token
  • 模态:原生支持文本、图像与视频理解
  • 核心方向:长周期编程、知识工作、深度推理与多模态 Agent
  • API 价格:缓存命中输入 0.30 美元、未命中输入 3 美元、输出 15 美元 / 百万 token
  • 开放计划:完整模型权重计划于 2026 年 7 月 27 日前发布
  • 当前推理模式:默认使用 max,low 与 high 模式后续上线

Kimi K3 的参数有多夸张?

项目Kimi K3
总参数量2.8T
专家数量896
每 token 激活专家16
激活参数量官方暂未公布
上下文窗口1,048,576 token
注意力架构Kimi Delta Attention(KDA)
深度信息流Attention Residuals(AttnRes)
MoE 架构Stable LatentMoE
量化训练MXFP4 权重、MXFP8 激活

2.8T 是总参数量,不代表每次推理都会调用全部参数。K3 采用高稀疏 MoE 架构,每个 token 只激活 16 个专家。官方没有公布准确的激活参数量,因此不能简单把 2.8T 当成实际推理规模。

Kimi 称,KDA、AttnRes 与 Stable LatentMoE 让 K3 相比 K2 获得约 2.5 倍整体扩展效率提升。简单说,它不是只把模型做大,也在解决长上下文速度、深层信息传递和超大规模 MoE 的训练稳定性。

价格对比:K3 最直接的优势

以下均为每 100 万 token 的标准 API 价格。GPT-5.6 Sol 采用短上下文价格;不同平台、长上下文和批处理价格可能不同。

模型缓存输入普通输入输出
Kimi K3$0.30$3$15
GPT-5.6 Sol$0.50$5$30
Claude Fable 5$1$10$50

和 Claude Fable 5 相比,K3 的普通输入与输出价格都只有约 30%;和 GPT-5.6 Sol 相比,输入便宜 40%,输出便宜 50%

按“100 万未缓存输入 + 20 万输出”粗算:

  • Kimi K3:6 美元
  • GPT-5.6 Sol:11 美元
  • Claude Fable 5:20 美元

如果是代码仓库、文档库等重复上下文较多的任务,缓存价格更关键。Kimi 称其官方 API 在编程负载中的缓存命中率超过 90%,这会进一步降低长周期 Agent 的实际成本。

和顶尖模型比,K3 到底处于什么位置?

Kimi 对 K3 的定位很克制:达到前沿水平,但整体仍落后于最强闭源模型。

模型核心优势主要取舍
Kimi K3价格低、100 万上下文、原生多模态、计划开放权重整体体验仍落后于 GPT-5.6 Sol 和 Claude Fable 5,部署门槛高
GPT-5.6 Sol综合推理、编程与 Agent 能力处于第一梯队闭源,API 成本高于 K3
Claude Fable 5长周期 Agent、复杂知识工作与代码任务强三者中 API 价格最高,闭源

Kimi 公布的测试显示,K3 在长周期编程、GPU Kernel 优化、知识工作和多模态创作上已具备很强竞争力。不过这些结果来自厂商评测,且不同模型使用的 Agent harness 并不完全一致,不能直接理解为 K3 已全面超过 GPT 或 Claude。

K3 真正值得关注的三个特点

1. 100 万上下文不是摆设

K3 的目标不是单轮聊天,而是大型代码库、长文档、持续研究和多工具 Agent。官方在 BrowseComp 测试中提到,K3 可直接使用 100 万上下文,不依赖频繁压缩历史记录。

2. 原生多模态进入编程闭环

K3 可以把代码、截图、图像和视频放进同一个工作流。它能根据运行截图继续修改前端、游戏和 CAD 项目,也能处理视频剪辑与动态图形任务。

3. 开放权重比参数规模更重要

2.8T 很吸睛,但完整权重开放才决定 K3 是否会影响开源生态。Kimi 表示权重将在 7 月 27 日前发布,不过官方也建议使用 64 张以上加速卡组成的超节点部署,这意味着普通团队很难低成本自托管完整模型。

现在还要注意这些限制

  • 发布初期只有 max 推理强度,低成本模式还未上线
  • 完整权重和技术报告尚未发布
  • 对完整思考历史较敏感,中途从其他模型切换到 K3 可能导致质量波动
  • 在意图模糊时可能过度主动,需要更严格的系统提示词或 AGENTS.md 约束
  • 官方明确承认,整体用户体验与 GPT-5.6 Sol、Claude Fable 5 仍有差距

结论

Kimi K3 不是“参数最大,所以能力最强”。它更准确的定位是:目前最激进的开放前沿模型之一,用闭源旗舰三到六成的 API 价格,提供接近第一梯队的长上下文、多模态和 Agent 能力。

对开发者来说,短期最值得看的不是 2.8T,而是两件事:实际 API 任务成本,以及 7 月 27 日权重发布后,开源推理框架能否真正接住这台超大模型。

参考来源:

分享文章

更多文章