Kimi K3:月之暗面开源稀疏 MoE 对你的 Agent Token 预算意味着什么

·阅读约 10 分钟·Evergreen Tools Team
Code on a laptop representing Kimi K3 API integration

💡 工具推荐要在多模型 Agent 栈里加入 Kimi K3?用 Evergreen Tools 的 AI Token 计数器按任务计量花费,用 AI 代码审查工具保证模型生成的 PR 质量,用 API Tester 在接入生产前先探一探 kimi-k3 端点。 AI Token 计数器, AI 代码审查工具, API 测试工具

2026 年夏天的开源模型竞赛里,月之暗面的 Kimi K3 是最激进的一注:2.8 万亿总参数的稀疏 MoE,896 个专家里每个 token 只激活 16 个,单次前向约激活 1040 亿参数。API 在 7 月 16 日上线,输入每百万 token 3 美元、输出 15 美元;7 月 27 日完整权重开放。对工程团队来说,K3 值得关注不是因为又一个「接近 Fable 5」的宣传,而是它把三个变量同时摆上台面:稀疏 MoE 的激活参数数学、开源许可证的真实边界、以及「前沿附近能力不再需要前沿价格」的成本分层。本文帮你把这三笔账算清楚,再决定要不要让 K3 进入你的路由栈。

1. K3 是谁、什么时候发布的

Kimi K3 是月之暗面(Moonshot AI)的旗舰多模态推理模型:2026 年 7 月 16 日先开放 API,7 月 27 日发布完整权重。官方把它宣传为「世界首个开放的 3 万亿级模型」,实际模型卡显示总参数约 2.8 万亿,上下文窗口约百万 token,支持文本、图像与视频输入,注意力采用 KDA 与 MLA 混合架构,用于在超长上下文下保持位置编码稳定。月之暗面在发布时声称 K3 与 Anthropic 的 Claude Fable 5「有竞争力」。独立媒体 9 月初仍在把它与 GPT-6 Astra、Qwen3.8-Max 等放在一起比较,说明它已经进入「预算敏感团队的 frontier 替代」讨论清单。

# Sparse MoE math: total vs active parameters decides cost.
TOTAL_PARAMS = 2_800_000_000_000   # 2.8T total (per model card)
EXPERTS = 896
ACTIVE_EXPERTS = 16
ACTIVE_PARAMS = TOTAL_PARAMS * ACTIVE_EXPERTS // EXPERTS
print("active params per token:", ACTIVE_PARAMS)   # ~104B

# Why it matters: your serving cost scales with ACTIVE, not TOTAL.

2. 稀疏 MoE 的数学:激活参数决定账单

896 个专家、每个 token 激活 16 个,意味着推理时约 1040 亿参数参与计算。这就是 MoE 的精髓:总参数决定知识容量,激活参数决定单次成本。所以比较 K3 与稠密模型时,别拿 2.8 万亿吓自己,也别把 1040 亿当成小模型——它需要的是 8 卡 80GB 级别的服务配置,而不是笔记本。对成本建模更重要的是 KV cache:百万 token 上下文意味着长文档任务的 cache 开销会显著上升,前缀缓存与上下文裁剪策略不是可选项,而是必需品。K3 的混合注意力设计就是为了让长上下文下的缓存与位置编码更稳定,但工程上你仍然要自己控制「喂给它的内容有多长」。

Dashboard charts representing token cost allocation across models
# Kimi K3 API pricing (July 2026): 3 USD input, 15 USD output per 1M tokens.
def k3_cost(input_tokens, output_tokens):
    return round(input_tokens / 1_000_000 * 3 + output_tokens / 1_000_000 * 15, 4)

def astra_cost(input_tokens, output_tokens):
    return round(input_tokens / 1_000_000 * 10 + output_tokens / 1_000_000 * 50, 4)

print("K3   :", k3_cost(100_000, 10_000))    # 0.45 USD
print("Astra:", astra_cost(100_000, 10_000))  # 1.50 USD

3. 价格位置:比 frontier 便宜 70%,但不是最便宜

按 2026 年 7 月的定价,K3 输入每百万 token 3 美元、输出 15 美元;对照 GPT-6 Astra 的 10/50 美元,同样 10 万输入 + 1 万输出的任务,K3 约 0.45 美元,Astra 约 1.5 美元,便宜约 70%。但媒体也直言:DeepSeek 与阿里的同类模型可以再便宜 20 到 50 倍,所以 K3 不是「最便宜」,而是「用可负担价格买到 frontier 附近能力」。正确姿势是把它放在路由栈中间层:日常琐碎任务交给 flash 级模型,长文档代理、仓库级分析、多轮 agentic 任务交给 K3,只有跨文件重构与计算机使用这类硬任务才升级到 Astra 级。层与层之间用预算上限兜底,避免代理在无人注意时烧钱。

# Route by task: cheap for routine, K3 for long-context agent work.
{
  "router": {
    "default": "qwen-flash",
    "kimi-k3": [
      "long_doc_agent", "repo_analysis", "multi_turn_agentic"
    ],
    "gpt-6-astra": ["cross_file_refactor", "computer_use"]
  },
  "budget": {"max_usd_per_task": 1.0, "alert_at_usd": 0.8}
}

4. 开源权重:先看清许可证再部署

K3 权重确实开放下载,但多个评测指出它的许可证比常见开源模型「复杂得多」。开源社区习惯把「能下权重」等同于「随便商用」,对 K3 这是危险的假设:不同版本的许可证可能限制商用规模、要求公开衍生品或附加额外条款。部署前必须做两件事:一是读 Hugging Face 模型卡上的 license 字段与原始许可证全文,而不是二手博客;二是让法务确认你的使用场景——尤其是把模型输出嵌入商业产品、用权重做微调后再分发这两种情况。用脚本读取模型卡 license 字段只需要几行代码,成本几乎为零,却能避免一次昂贵的合规事故。

Team reviewing code representing agent workload evaluation

5. 部署与接入:从 API 试到自托管

推荐的接入顺序是「先 API、后自托管」。先用 API Tester 之类工具验证 kimi-k3 端点在你真实负载下的延迟与错误率,跑两周记录每个任务的 token 消耗,用 AI Token 计数器算出真实单价;只有当 API 成本明显高于闲置 GPU 的边际成本时,才值得投入 vLLM 自托管。自托管时按约 1040 亿激活参数规划显存:8 卡 80GB 加 FP8 量化是常见起点,开启 prefix caching 控制长上下文成本。无论哪种方式,路由层都要带上任务标签与预算上限,这样你随时可以用同一套评测把流量切回更便宜的模型。

# Check the open-weight license before you self-host.
# Read the license field straight from the Hugging Face model card.
import urllib.request, json

def license_of(model_id):
    url = "https://huggingface.co/api/models/" + model_id
    with urllib.request.urlopen(url, timeout=30) as r:
        card = json.loads(r.read().decode())
    return card.get("cardData", {}).get("license", "unknown")

print(license_of("moonshotai/Kimi-K3"))

6. 用你自己的代理任务做评测

别用「接近 Fable 5」这种宣传句做决策。抽 15 到 20 个真实代理任务,最好覆盖长文档分析、仓库级搜索、多轮工具调用与代码修改四类,让 K3 与你当前的中间层模型各跑一遍,比较解决率、每任务 token、墙钟时间与失败模式。特别注意长上下文任务:K3 的百万 token 窗口在「一次塞进整个仓库」时很有吸引力,但你要验证它在 50 万 token 以上是否还能稳定遵循指令,而不是只看演示。两周数据出来后,把结果贴进路由配置:K3 能稳定赢的任务留给 K3,不能的就留在原模型——这才是「前沿附近能力不再需要前沿价格」的正确打开方式。

# vLLM shape for a 104B-active open model (adjust to real GPUs).
{
  "model": "moonshotai/Kimi-K3",
  "tensor_parallel_size": 8,
  "max_model_len": 131072,
  "gpu_memory_utilization": 0.9,
  "enable_prefix_caching": true,
  "quantization": "fp8",
  "served_model_name": "kimi-k3"
}

📌 常见问题 FAQ

Kimi K3 是什么时候发布的?

2026 年 7 月 16 日开放 API,7 月 27 日发布完整权重;总参数约 2.8 万亿,每 token 激活约 1040 亿参数的稀疏 MoE。

Kimi K3 是什么时候发布的?

2026 年 7 月 16 日开放 API,7 月 27 日发布完整权重;总参数约 2.8 万亿,每 token 激活约 1040 亿参数的稀疏 MoE。

Kimi K3 是什么时候发布的?

2026 年 7 月 16 日开放 API,7 月 27 日发布完整权重;总参数约 2.8 万亿,每 token 激活约 1040 亿参数的稀疏 MoE。

Kimi K3 是什么时候发布的?

2026 年 7 月 16 日开放 API,7 月 27 日发布完整权重;总参数约 2.8 万亿,每 token 激活约 1040 亿参数的稀疏 MoE。

Kimi K3 是什么时候发布的?

2026 年 7 月 16 日开放 API,7 月 27 日发布完整权重;总参数约 2.8 万亿,每 token 激活约 1040 亿参数的稀疏 MoE。

Kimi K3 的 API 价格是多少?

输入每百万 token 3 美元、输出 15 美元,约为 GPT-6 Astra 标准定价(10/50 美元)的 30%;但 DeepSeek、阿里等模型可再便宜 20 到 50 倍。

Kimi K3 的 API 价格是多少?

输入每百万 token 3 美元、输出 15 美元,约为 GPT-6 Astra 标准定价(10/50 美元)的 30%;但 DeepSeek、阿里等模型可再便宜 20 到 50 倍。

Kimi K3 的 API 价格是多少?

输入每百万 token 3 美元、输出 15 美元,约为 GPT-6 Astra 标准定价(10/50 美元)的 30%;但 DeepSeek、阿里等模型可再便宜 20 到 50 倍。

Kimi K3 的 API 价格是多少?

输入每百万 token 3 美元、输出 15 美元,约为 GPT-6 Astra 标准定价(10/50 美元)的 30%;但 DeepSeek、阿里等模型可再便宜 20 到 50 倍。

Kimi K3 的 API 价格是多少?

输入每百万 token 3 美元、输出 15 美元,约为 GPT-6 Astra 标准定价(10/50 美元)的 30%;但 DeepSeek、阿里等模型可再便宜 20 到 50 倍。

K3 的权重是真正「开源」的吗?

权重可以下载,但许可证比常见开源模型复杂,商用前必须核对 Hugging Face 模型卡的 license 字段与全文条款。

K3 的权重是真正「开源」的吗?

权重可以下载,但许可证比常见开源模型复杂,商用前必须核对 Hugging Face 模型卡的 license 字段与全文条款。

K3 的权重是真正「开源」的吗?

权重可以下载,但许可证比常见开源模型复杂,商用前必须核对 Hugging Face 模型卡的 license 字段与全文条款。

K3 的权重是真正「开源」的吗?

权重可以下载,但许可证比常见开源模型复杂,商用前必须核对 Hugging Face 模型卡的 license 字段与全文条款。

K3 的权重是真正「开源」的吗?

权重可以下载,但许可证比常见开源模型复杂,商用前必须核对 Hugging Face 模型卡的 license 字段与全文条款。

K3 适合放在路由栈的哪一层?

适合中间层:日常任务用 flash 级模型,长文档代理、仓库分析、多轮 agentic 任务用 K3,跨文件重构与计算机使用留给 Astra 级模型。

K3 适合放在路由栈的哪一层?

适合中间层:日常任务用 flash 级模型,长文档代理、仓库分析、多轮 agentic 任务用 K3,跨文件重构与计算机使用留给 Astra 级模型。

K3 适合放在路由栈的哪一层?

适合中间层:日常任务用 flash 级模型,长文档代理、仓库分析、多轮 agentic 任务用 K3,跨文件重构与计算机使用留给 Astra 级模型。

K3 适合放在路由栈的哪一层?

适合中间层:日常任务用 flash 级模型,长文档代理、仓库分析、多轮 agentic 任务用 K3,跨文件重构与计算机使用留给 Astra 级模型。

K3 适合放在路由栈的哪一层?

适合中间层:日常任务用 flash 级模型,长文档代理、仓库分析、多轮 agentic 任务用 K3,跨文件重构与计算机使用留给 Astra 级模型。

自托管 K3 需要什么硬件?

约 1040 亿激活参数通常需要 8 卡 80GB GPU 级别的服务节点,配合 FP8 量化与 prefix caching;先跑 API 再决定是否自托管更稳妥。

自托管 K3 需要什么硬件?

约 1040 亿激活参数通常需要 8 卡 80GB GPU 级别的服务节点,配合 FP8 量化与 prefix caching;先跑 API 再决定是否自托管更稳妥。

自托管 K3 需要什么硬件?

约 1040 亿激活参数通常需要 8 卡 80GB GPU 级别的服务节点,配合 FP8 量化与 prefix caching;先跑 API 再决定是否自托管更稳妥。

自托管 K3 需要什么硬件?

约 1040 亿激活参数通常需要 8 卡 80GB GPU 级别的服务节点,配合 FP8 量化与 prefix caching;先跑 API 再决定是否自托管更稳妥。

自托管 K3 需要什么硬件?

约 1040 亿激活参数通常需要 8 卡 80GB GPU 级别的服务节点,配合 FP8 量化与 prefix caching;先跑 API 再决定是否自托管更稳妥。