Qwen3.8-Max 开放权重正式发布:用阿里 2.4T 参数 MoE 跑 Agentic 编码

·阅读约 11 分钟·Evergreen Tools Team
JavaScript code on a monitor representing Qwen open-weight model integration

💡 工具推荐想用 Qwen3.8-Max 评估自己的代码库?先用 Evergreen Tools 的 AI Token 计数器估算每个任务的 token 开销,用 Text Diff Checker 找出开源模型到底改了什么,再用 AI 代码审查工具对每个模型生成的改动做一致的二次检查。 AI Token 计数器, 文本差异对比工具, AI 代码审查工具

2026 年 8 月中旬,阿里把 Qwen3.8-Max 的权重以 Qwen3.8-2.4T-A95B 的名字开源到 Hugging Face 与 ModelScope,这是 Qwen 首次开源 Max 级模型。对开发者来说,这意味着「接近前沿的 Agentic 编码能力 + 可以自己部署」两个条件第一次同时成立:2.4 万亿总参数、每 token 约激活 950 亿参数的稀疏 MoE、原生百万 token 上下文,还有 9 月初更新的 0902 版本。但开源 ≠ 免费,自托管不等于省钱。这篇指南帮你弄清楚:到底发布了什么、激活参数为什么重要、9 月的基准表该怎么读、自托管与 API 的成本账怎么算,以及如何先用你自己的仓库做评测再决定切换。

1. 8 月中旬到底开源了什么

Qwen3.8-Max 本身在 2026 年 8 月 3 日以 API 形式发布,团队随后在 8 月中旬把基础权重 Qwen3.8-2.4T-A95B 放上 Hugging Face 与 ModelScope。命名里的 A95B 指每个 token 激活约 950 亿参数,总参数则是 2.4 万亿,属于典型的稀疏 MoE。官方主页强调视觉输入能力、默认不开启思考、原生支持约百万 token 上下文,并内置官方工具调用。9 月初又出现 0902 刷新版本,DataCamp 在 9 月 2 日发布了对应评测。对工程团队最重要的信息是:这是 Max 级模型第一次可以脱离阿里云 API 自主运行,Claude Code 等工具也已经开始支持把 Qwen 当作后端模型。

# vLLM config for the open-weight MoE (minimal, adjust to your GPUs).
# Model card: Qwen/Qwen3.8-2.4T-A95B on Hugging Face / ModelScope.
{
  "model": "Qwen/Qwen3.8-2.4T-A95B",
  "tensor_parallel_size": 8,
  "max_model_len": 131072,
  "gpu_memory_utilization": 0.9,
  "enforce_eager": false,
  "enable_prefix_caching": true,
  "served_model_name": "qwen38-max"
}

2. 为什么 A95B 激活参数决定你能不能自托管

2.4 万亿是总参数,但每次推理只激活约 950 亿,这是 MoE 的核心设计:知识容量接近大模型,而单次前向计算量接近小模型。对部署来说,真正决定显存与吞吐的是激活参数与 KV cache,而不是总参数。950 亿激活参数意味着它依然不是笔记本能跑的模型:在 8 卡 80GB 的节点上用 vLLM 加载是常见起步配置,或者用 4 到 8 卡做张量并行与量化。Qwen 系列里能在本地单机跑的是 27B 等小尺寸版本,而 2.4T-A95B 面向的是有 GPU 集群或云租用 GPU 的团队。先把这句话记住:开源解决的是数据主权与供应商锁定,不是显存问题。

Abstract neural network visual representing the 2.4 trillion parameter MoE
# Route routine coding to the open model, hard tasks to the frontier API.
ROUTER = {
  "default": "qwen38-max",          # self-hosted open weights
  "override": {
    "cross_file_refactor": "gpt-6-astra",
    "long_doc_analysis": "qwen38-max",  # 1M context shines here
    "computer_use": "gpt-6-astra"
  }
}

def pick(task_type):
    return ROUTER.get(task_type, ROUTER["default"])

3. 9 月基准表:哪些数字真的接近 Opus 5

9 月 2 日 DataCamp 评测与 0902 刷新的数字值得仔细读:DeepSWE 1.1 上 Qwen3.8-Max-0902 为 69.3,Claude Opus 5 为 73.6;NL2Repo-Bench 为 64.9 对 72.3;SWE-Marathon 为 44.8 对 50.0;而 MLS-Bench-Lite 上 Qwen 以 50.1 反超 Opus 5 的 49.8。但 TerminalBench 3.0 上 Qwen 只有 29.0,Opus 5 高达 42.7,差距仍然明显。更早的 8 月 3 日官方博客显示 Terminal Bench 2.1 为 86.6,SWE-bench Pro 为 67.7,PaperBench 为 93.0。结论:在仓库级任务、长上下文与部分代理基准上它已进入同一梯队,但在需要长时间终端操作的场景仍落后。不要看单一分数,要看你的任务落在哪一列。

# Self-host vs API break-even helper.
# Fill in your own numbers: measured tokens per week, infra cost, API price.
def break_even(tokens_per_week, infra_usd_per_week, api_usd_per_1m):
    api = tokens_per_week / 1_000_000 * api_usd_per_1m
    return {
        "api_cost_per_week": round(api, 2),
        "infra_cost_per_week": infra_usd_per_week,
        "open_weights_win": infra_usd_per_week < api
    }

print(break_even(80_000_000, 900, 0.8))

4. 自托管与 API:算清真正的成本账

开源模型最大的坑是把 GPU 成本当成零。正确做法是记录一周的真实 token 消耗:把每周 token 数乘以 API 单价得到 API 方案成本,再与 GPU 集群的折旧或云租用成本对比,找到盈亏平衡点。Qwen API 的价格远低于西方前沿厂商,这本身就是很多成本敏感团队选择它的原因;如果你已经有闲置 GPU,自托管可以进一步压低边际成本。但别忘了三笔隐形开销:运维与监控人力、多卡推理的工程调试、以及模型升级时重新评测的成本。建议先跑两周 API 或托管推理,用 AI Token 计数器记录每个任务的 token,再决定要不要投入自托管。

Server rack representing self-hosted model deployment

5. 最小可用的部署方案

最小可行部署分三步。第一,用 vLLM 起一个 OpenAI 兼容端点,模型 ID 填 Qwen/Qwen3.8-2.4T-A95B,按显存设置 tensor_parallel_size 与 gpu_memory_utilization,开启 prefix caching,避免长系统提示与稳定仓库上下文被反复重算。第二,把路由层默认指向自托管端点,只把跨文件重构、计算机使用等硬任务升级到 frontier API——这正是开源权重最常见的用法:便宜模型干 80% 的日常活。第三,为百万 token 上下文单独配置:关闭思考、控制 max_tokens、限定注入文档长度,防止一次请求把预算和延迟都打爆。

# Run both models on the same 20 tasks before you switch.
# Compare resolved rate, tokens used, and wall time per task.
TASKS = ["add pagination", "fix flaky test", "refactor auth middleware"]

def evaluate(endpoint, tasks):
    results = []
    for t in tasks:
        r = call(endpoint, t)          # your client
        results.append({
            "task": t,
            "resolved": r.resolved,
            "tokens": r.total_tokens,
            "seconds": r.wall_seconds
        })
    return results

for name, ep in [("qwen38-max", "http://localhost:8000/v1"), ("astra", "api.openai.com")]:
    print(name, summarize(evaluate(ep, TASKS)))

6. 切换前的最后一道工序:用自己的仓库评测

发布博客和第三方基准都只能当参考,真正的决策数据来自你自己的代码库。抽 20 个有代表性的任务——加分页、修 flaky 测试、重构认证中间件——让 Qwen3.8-Max 与你当前模型各跑一遍,比较三个指标:解决率、每个任务消耗的 token、墙钟时间。用 Text Diff Checker 检查它改了什么,用 AI Code Reviewer 对改动做二次审查,两周后再决定是否全量切换。记住:开源权重的好处是你可以随时用同一套评测重测新版本,把「换模型」变成一次低风险的例行实验,而不是发布会驱动的豪赌。

// Long-context config for the 1M-token window.
// Enable prefix caching so a stable repo context is not re-read per request.
{
  "model": "qwen38-max",
  "max_tokens": 8192,
  "enable_thinking": false,
  "cache": {"prefix": true, "max_prefix_tokens": 65536},
  "documents": {"strategy": "append", "limit_chars": 900000}
}

📌 常见问题 FAQ

Qwen3.8-Max 是什么时候开源的?

2026 年 8 月 3 日先以 API 形式发布 Qwen3.8-Max,8 月中旬把基础权重 Qwen3.8-2.4T-A95B 开源到 Hugging Face 与 ModelScope,9 月初又发布了 0902 刷新版本。

Qwen3.8-Max 是什么时候开源的?

2026 年 8 月 3 日先以 API 形式发布 Qwen3.8-Max,8 月中旬把基础权重 Qwen3.8-2.4T-A95B 开源到 Hugging Face 与 ModelScope,9 月初又发布了 0902 刷新版本。

Qwen3.8-Max 是什么时候开源的?

2026 年 8 月 3 日先以 API 形式发布 Qwen3.8-Max,8 月中旬把基础权重 Qwen3.8-2.4T-A95B 开源到 Hugging Face 与 ModelScope,9 月初又发布了 0902 刷新版本。

Qwen3.8-Max 是什么时候开源的?

2026 年 8 月 3 日先以 API 形式发布 Qwen3.8-Max,8 月中旬把基础权重 Qwen3.8-2.4T-A95B 开源到 Hugging Face 与 ModelScope,9 月初又发布了 0902 刷新版本。

Qwen3.8-Max 是什么时候开源的?

2026 年 8 月 3 日先以 API 形式发布 Qwen3.8-Max,8 月中旬把基础权重 Qwen3.8-2.4T-A95B 开源到 Hugging Face 与 ModelScope,9 月初又发布了 0902 刷新版本。

Qwen3.8-2.4T-A95B 名字里的 A95B 是什么意思?

A95B 表示每个 token 激活约 950 亿参数的稀疏 MoE 架构,总参数为 2.4 万亿;推理成本主要由激活参数决定。

Qwen3.8-2.4T-A95B 名字里的 A95B 是什么意思?

A95B 表示每个 token 激活约 950 亿参数的稀疏 MoE 架构,总参数为 2.4 万亿;推理成本主要由激活参数决定。

Qwen3.8-2.4T-A95B 名字里的 A95B 是什么意思?

A95B 表示每个 token 激活约 950 亿参数的稀疏 MoE 架构,总参数为 2.4 万亿;推理成本主要由激活参数决定。

Qwen3.8-2.4T-A95B 名字里的 A95B 是什么意思?

A95B 表示每个 token 激活约 950 亿参数的稀疏 MoE 架构,总参数为 2.4 万亿;推理成本主要由激活参数决定。

Qwen3.8-2.4T-A95B 名字里的 A95B 是什么意思?

A95B 表示每个 token 激活约 950 亿参数的稀疏 MoE 架构,总参数为 2.4 万亿;推理成本主要由激活参数决定。

它和 Claude Opus 5 的差距有多大?

按 DataCamp 2026 年 9 月 2 日评测,0902 版本在 DeepSWE 1.1 为 69.3 对 73.6、NL2Repo-Bench 为 64.9 对 72.3,MLS-Bench-Lite 上以 50.1 反超 49.8;但 TerminalBench 3.0 仅 29.0,远低于 42.7。

它和 Claude Opus 5 的差距有多大?

按 DataCamp 2026 年 9 月 2 日评测,0902 版本在 DeepSWE 1.1 为 69.3 对 73.6、NL2Repo-Bench 为 64.9 对 72.3,MLS-Bench-Lite 上以 50.1 反超 49.8;但 TerminalBench 3.0 仅 29.0,远低于 42.7。

它和 Claude Opus 5 的差距有多大?

按 DataCamp 2026 年 9 月 2 日评测,0902 版本在 DeepSWE 1.1 为 69.3 对 73.6、NL2Repo-Bench 为 64.9 对 72.3,MLS-Bench-Lite 上以 50.1 反超 49.8;但 TerminalBench 3.0 仅 29.0,远低于 42.7。

它和 Claude Opus 5 的差距有多大?

按 DataCamp 2026 年 9 月 2 日评测,0902 版本在 DeepSWE 1.1 为 69.3 对 73.6、NL2Repo-Bench 为 64.9 对 72.3,MLS-Bench-Lite 上以 50.1 反超 49.8;但 TerminalBench 3.0 仅 29.0,远低于 42.7。

它和 Claude Opus 5 的差距有多大?

按 DataCamp 2026 年 9 月 2 日评测,0902 版本在 DeepSWE 1.1 为 69.3 对 73.6、NL2Repo-Bench 为 64.9 对 72.3,MLS-Bench-Lite 上以 50.1 反超 49.8;但 TerminalBench 3.0 仅 29.0,远低于 42.7。

我能在一台笔记本上跑它吗?

不能。950 亿激活参数需要多卡 GPU(常见起步是 8 卡 80GB 或用 vLLM 做张量并行与量化);笔记本适合跑 Qwen 系列更小的 27B 等版本。

我能在一台笔记本上跑它吗?

不能。950 亿激活参数需要多卡 GPU(常见起步是 8 卡 80GB 或用 vLLM 做张量并行与量化);笔记本适合跑 Qwen 系列更小的 27B 等版本。

我能在一台笔记本上跑它吗?

不能。950 亿激活参数需要多卡 GPU(常见起步是 8 卡 80GB 或用 vLLM 做张量并行与量化);笔记本适合跑 Qwen 系列更小的 27B 等版本。

我能在一台笔记本上跑它吗?

不能。950 亿激活参数需要多卡 GPU(常见起步是 8 卡 80GB 或用 vLLM 做张量并行与量化);笔记本适合跑 Qwen 系列更小的 27B 等版本。

我能在一台笔记本上跑它吗?

不能。950 亿激活参数需要多卡 GPU(常见起步是 8 卡 80GB 或用 vLLM 做张量并行与量化);笔记本适合跑 Qwen 系列更小的 27B 等版本。

开源权重可以商用吗?

权重以开放许可发布,商用前请以 Hugging Face 模型卡上的最新许可条款为准;Qwen 系列通常对商用友好,但每次升级都要重新核对。

开源权重可以商用吗?

权重以开放许可发布,商用前请以 Hugging Face 模型卡上的最新许可条款为准;Qwen 系列通常对商用友好,但每次升级都要重新核对。

开源权重可以商用吗?

权重以开放许可发布,商用前请以 Hugging Face 模型卡上的最新许可条款为准;Qwen 系列通常对商用友好,但每次升级都要重新核对。

开源权重可以商用吗?

权重以开放许可发布,商用前请以 Hugging Face 模型卡上的最新许可条款为准;Qwen 系列通常对商用友好,但每次升级都要重新核对。

开源权重可以商用吗?

权重以开放许可发布,商用前请以 Hugging Face 模型卡上的最新许可条款为准;Qwen 系列通常对商用友好,但每次升级都要重新核对。