GLM-5.3-Flash 开源:把 Agent 流量路由到每百万输入仅 0.15 美元的 320B MoE
💡 工具推荐:在把生产流量切到 GLM-5.3-Flash 之前,先用你自己的任务做基准:用 AI Token 计数器算清每个任务到底花多少钱,用 JSON 格式化工具校验路由器收到的 JSON 响应,再用 API 测试工具验证接口。 AI Token 计数器, JSON 格式化工具, API 测试工具
2026 年 8 月下旬,全球开发者圈子里出现了一个神秘的匿名模型「Ox-Alpha」,在 OpenRouter 和 OpenCode 上跑分惊艳,引发大量猜测。8 月 26 日晚,谜底揭晓:智谱 AI(Z.ai)正式发布并开源 GLM-5.3-Flash,确认 Ox-Alpha 就是它。这是一款 320B 总参数、18B 激活参数的 MoE 模型,是 GLM-5 系列第一款原生多模态模型,官方口径是全程在约 10 万颗国产芯片的集群上训练与运行。定价更让开发者兴奋:输入每百万 token 0.15 美元、输出 0.50 美元,缓存输入 0.03 美元,还有两周限时半价——约为 Claude Opus 4.8 的 1/40,和 DeepSeek 处于同一低价档。本文拆解发布细节、为什么这个价格对 Agent 负载意义重大,以及如何把它接进你的模型路由。
1. Ox-Alpha 谜底:GLM-5.3-Flash 发布了什么
GLM-5.3-Flash 的发布节奏很特别:先以 Ox-Alpha 的匿名身份在 OpenRouter、OpenCode 等平台被开发者测试了约六天,再于 8 月 26 日晚揭晓真身并同步开源权重。模型本身是稀疏 MoE:总参数 320B,每个 token 只激活约 18B 参数,这让推理成本远低于同量级稠密模型。它是 GLM-5 系列第一个原生多模态模型,官方称训练与推理全部跑在约 10 万颗国产芯片的集群上,供应链意义被 Global Times、Quartz 等媒体重点报道。对开发者来说,可下载的权重意味着你可以在自己的基础设施上跑,也可以直接调用 API,OpenRouter 等聚合平台同步上架。
# Price GLM-5.3-Flash vs a frontier model for an agent turn.
# Flash: $0.15/M input, $0.50/M output, $0.03/M cached input.
def flash_cost(inp, out, cached):
return (cached * 0.03 + inp * 0.15 + out * 0.50) / 1_000_000
def frontier_cost(inp, out, cached):
return (cached * 2.50 + inp * 15.00 + out * 75.00) / 1_000_000
# Typical agent turn: 60K cached prefix, 4K new input, 1K output.
print("flash: " + "$" + f"{flash_cost(4000, 1000, 60000):.4f}")
print("frontier: " + "$" + f"{frontier_cost(4000, 1000, 60000):.4f}")2. 价格账:0.15 美元/百万输入意味着什么
Z.ai 给 GLM-5.3-Flash 的定价是输入每百万 token 0.15 美元、输出 0.50 美元、缓存输入 0.03 美元,发布时还推出两周限时半价(输入 0.075、输出 0.25、缓存 0.015)。按 Bloomberg 与 Quartz 的报道口径,这把它放进与 DeepSeek 相同的低价档;BigGo 的测算称其约为 Claude Opus 4.8 价格的 1/40。为什么对 Agent 意义重大?因为 Agent 循环里大量轮次是重复读取长上下文与工具定义——缓存输入低到 0.03 美元意味着这类「无聊轮次」的成本可以被压到几乎可忽略。真正的省钱不是换一个更便宜的前沿模型,而是让便宜模型承接高重复、低难度的轮次。
# A tiny router: cheap model for routine turns, frontier for hard ones.
def route(task, estimated_hardness):
if estimated_hardness < 0.4:
return "glm-5.3-flash" # boilerplate, parsing, drafts
if estimated_hardness < 0.8:
return "glm-5.3" # mid-tier coding model
return "claude-opus-4.8" # gnarly architecture work
print(route("wrap this in a try/except", 0.2))
print(route("design the retry strategy", 0.9))3. GLM-5.3 vs GLM-5.3-Flash:编码主力与性价比走量
需要区分两个模型:8 月 14 日左右发布的 GLM-5.3 是 743B 总参数、40B 激活的编码向 MoE,官方称仅靠后训练就让编码能力追上 Claude Fable 5,还因发现 1981 年的老漏洞引起安全圈关注;8 月 26 日的 GLM-5.3-Flash 则是 320B/18B 的原生多模态轻量版,价格约为 GLM-5.3 的十分之一。选择逻辑很清晰:需要深度推理、复杂重构、多文件理解时用 GLM-5.3 或前沿模型;解析、改写、模板化、简单问答这类高重复任务交给 Flash。Artificial Analysis 等第三方评测也把 Flash 定位为高性价比档,而非旗舰替代品。
# GLM-5.3-Flash is a 320B MoE with 18B active parameters:
# only ~18B run per forward pass, which is why it stays cheap.
MODEL = {"total_params_b": 320, "active_params_b": 18, "multimodal": True}
print(f"active ratio: {MODEL['active_params_b'] / MODEL['total_params_b']:.1%}")4. 为什么 18B 激活参数对自托管是好消息
对想自托管的团队,MoE 的关键数字不是总参数 320B,而是激活参数 18B:单次前向传播真正参与计算的只有约 18B,这意味着显存与算力需求远低于稠密 320B 模型,单机多卡甚至量化后的小集群就能跑起来。与 Qwen3.8-Max(2.4T 总参、95B 激活)这类超大开放权重模型相比,Flash 的硬件门槛低一个数量级。再加上国产芯片训练的背景,它也是评估「去依赖单一硬件供应商」时值得关注的对象。部署前记得用环境变量工具管理多套 API Key,自托管则要仔细评估许可证条款允许的使用范围。
5. 把 Flash 接进模型路由:三层策略
接入方式不是「全切」或「不切」,而是三层路由:第一层,用规则或轻量分类器判断任务难度,低难度轮次直接走 Flash;第二层,中等复杂度的编码任务走 GLM-5.3 这类中档模型;第三层,架构设计、跨模块重构等难题才上 Claude Opus 4.8 这类前沿模型。路由层要记录每次调用的实际 token 用量并折算美元,用成本账本算出混合单价——你要优化的 KPI 是「每完成一个任务的混合成本」,而不是单一模型的单价。任何路由上线前,先用你自己的任务集做冒烟测试,别只看第三方基准。
# OpenAI-compatible chat call to GLM-5.3-Flash.
import os, requests
resp = requests.post(
"https://api.z.ai/api/paas/v4/chat/completions",
headers={"Authorization": f"Bearer {os.environ['ZAI_API_KEY']}"},
json={
"model": "glm-5.3-flash",
"messages": [
{"role": "user", "content": "Explain why MoE keeps inference cheap."}
],
},
timeout=30,
)
print(resp.json()["choices"][0]["message"]["content"])6. 落地建议:先测再切、小步灰度
给团队三条建议。第一,别把第三方基准当采购依据:拿 20-50 个你团队真实的任务,分别用 Flash 和现有模型跑一遍,对比通过率与成本/任务比,再决定路由阈值。第二,先灰度后全量:让 5%-10% 的流量走 Flash 一周,盯紧失败率、重试率和人工修正率,确认没有隐性成本转移(便宜模型省的钱可能被更多人工返工吃掉)。第三,持续记录混合成本:模型价格变动很快,Flash 半价活动、新版本发布都会改变最优路由,把成本账本做成自动化的看板,而不是一次性决策。开源模型的好处是你不必等厂商——权重在手,随时可以在自己的硬件上重新评估。
# Track your blended cost per task after enabling flash routing.
class CostLedger:
def __init__(self):
self.total = 0.0
self.tasks = 0
def record(self, usd):
self.total += usd
self.tasks += 1
def blended(self):
return self.total / max(self.tasks, 1)
ledger = CostLedger()
ledger.record(0.0008) # flash turn
ledger.record(0.42) # frontier turn
print("blended: " + "$" + f"{ledger.blended():.4f} per task")📌 常见问题 FAQ
GLM-5.3-Flash 是什么时候发布的?
2026 年 8 月 26 日晚由智谱 AI(Z.ai)正式发布并开源,此前约六天它以「Ox-Alpha」的匿名身份在 OpenRouter 等平台被开发者测试。
GLM-5.3-Flash 是什么时候发布的?
2026 年 8 月 26 日晚由智谱 AI(Z.ai)正式发布并开源,此前约六天它以「Ox-Alpha」的匿名身份在 OpenRouter 等平台被开发者测试。
GLM-5.3-Flash 是什么时候发布的?
2026 年 8 月 26 日晚由智谱 AI(Z.ai)正式发布并开源,此前约六天它以「Ox-Alpha」的匿名身份在 OpenRouter 等平台被开发者测试。
GLM-5.3-Flash 是什么时候发布的?
2026 年 8 月 26 日晚由智谱 AI(Z.ai)正式发布并开源,此前约六天它以「Ox-Alpha」的匿名身份在 OpenRouter 等平台被开发者测试。
GLM-5.3-Flash 是什么时候发布的?
2026 年 8 月 26 日晚由智谱 AI(Z.ai)正式发布并开源,此前约六天它以「Ox-Alpha」的匿名身份在 OpenRouter 等平台被开发者测试。
GLM-5.3-Flash 的定价是多少?
输入每百万 token 0.15 美元、输出 0.50 美元、缓存输入 0.03 美元,发布时有两周限时半价;媒体测算约为 Claude Opus 4.8 的 1/40,与 DeepSeek 同处低价档。
GLM-5.3-Flash 的定价是多少?
输入每百万 token 0.15 美元、输出 0.50 美元、缓存输入 0.03 美元,发布时有两周限时半价;媒体测算约为 Claude Opus 4.8 的 1/40,与 DeepSeek 同处低价档。
GLM-5.3-Flash 的定价是多少?
输入每百万 token 0.15 美元、输出 0.50 美元、缓存输入 0.03 美元,发布时有两周限时半价;媒体测算约为 Claude Opus 4.8 的 1/40,与 DeepSeek 同处低价档。
GLM-5.3-Flash 的定价是多少?
输入每百万 token 0.15 美元、输出 0.50 美元、缓存输入 0.03 美元,发布时有两周限时半价;媒体测算约为 Claude Opus 4.8 的 1/40,与 DeepSeek 同处低价档。
GLM-5.3-Flash 的定价是多少?
输入每百万 token 0.15 美元、输出 0.50 美元、缓存输入 0.03 美元,发布时有两周限时半价;媒体测算约为 Claude Opus 4.8 的 1/40,与 DeepSeek 同处低价档。
GLM-5.3 和 GLM-5.3-Flash 有什么区别?
GLM-5.3 是 743B 总参、40B 激活的编码向 MoE(8 月中旬发布,编码能力据称追上 Claude Fable 5);GLM-5.3-Flash 是 320B/18B 的原生多模态轻量版,价格约为前者的十分之一。
GLM-5.3 和 GLM-5.3-Flash 有什么区别?
GLM-5.3 是 743B 总参、40B 激活的编码向 MoE(8 月中旬发布,编码能力据称追上 Claude Fable 5);GLM-5.3-Flash 是 320B/18B 的原生多模态轻量版,价格约为前者的十分之一。
GLM-5.3 和 GLM-5.3-Flash 有什么区别?
GLM-5.3 是 743B 总参、40B 激活的编码向 MoE(8 月中旬发布,编码能力据称追上 Claude Fable 5);GLM-5.3-Flash 是 320B/18B 的原生多模态轻量版,价格约为前者的十分之一。
GLM-5.3 和 GLM-5.3-Flash 有什么区别?
GLM-5.3 是 743B 总参、40B 激活的编码向 MoE(8 月中旬发布,编码能力据称追上 Claude Fable 5);GLM-5.3-Flash 是 320B/18B 的原生多模态轻量版,价格约为前者的十分之一。
GLM-5.3 和 GLM-5.3-Flash 有什么区别?
GLM-5.3 是 743B 总参、40B 激活的编码向 MoE(8 月中旬发布,编码能力据称追上 Claude Fable 5);GLM-5.3-Flash 是 320B/18B 的原生多模态轻量版,价格约为前者的十分之一。
为什么 MoE 的激活参数比总参数重要?
MoE 每次前向只激活部分专家:Flash 激活约 18B,决定显存与算力需求的是激活参数而非 320B 总参数,这让自托管门槛大幅降低。
为什么 MoE 的激活参数比总参数重要?
MoE 每次前向只激活部分专家:Flash 激活约 18B,决定显存与算力需求的是激活参数而非 320B 总参数,这让自托管门槛大幅降低。
为什么 MoE 的激活参数比总参数重要?
MoE 每次前向只激活部分专家:Flash 激活约 18B,决定显存与算力需求的是激活参数而非 320B 总参数,这让自托管门槛大幅降低。
为什么 MoE 的激活参数比总参数重要?
MoE 每次前向只激活部分专家:Flash 激活约 18B,决定显存与算力需求的是激活参数而非 320B 总参数,这让自托管门槛大幅降低。
为什么 MoE 的激活参数比总参数重要?
MoE 每次前向只激活部分专家:Flash 激活约 18B,决定显存与算力需求的是激活参数而非 320B 总参数,这让自托管门槛大幅降低。
普通团队应该把流量全切到 GLM-5.3-Flash 吗?
不应该。建议用三层路由:低难度轮次走 Flash、中等走 GLM-5.3、难题走前沿模型,并用成本/任务比做灰度验证后再逐步放大流量。
普通团队应该把流量全切到 GLM-5.3-Flash 吗?
不应该。建议用三层路由:低难度轮次走 Flash、中等走 GLM-5.3、难题走前沿模型,并用成本/任务比做灰度验证后再逐步放大流量。
普通团队应该把流量全切到 GLM-5.3-Flash 吗?
不应该。建议用三层路由:低难度轮次走 Flash、中等走 GLM-5.3、难题走前沿模型,并用成本/任务比做灰度验证后再逐步放大流量。
普通团队应该把流量全切到 GLM-5.3-Flash 吗?
不应该。建议用三层路由:低难度轮次走 Flash、中等走 GLM-5.3、难题走前沿模型,并用成本/任务比做灰度验证后再逐步放大流量。
普通团队应该把流量全切到 GLM-5.3-Flash 吗?
不应该。建议用三层路由:低难度轮次走 Flash、中等走 GLM-5.3、难题走前沿模型,并用成本/任务比做灰度验证后再逐步放大流量。