Grok 4.6 与新的扩展杠杆:在 Agentic 环境里做后训练

·阅读约11分钟·Evergreen Tools Team

SpaceXAI 于 2026 年 8 月 12 日发布 Grok 4.6:没有新基座模型、没有新架构,只是更长的后训练、重新生成的 SFT 轨迹,以及在 Agentic 环境中的强化学习。它在 Artificial Analysis 智能指数上得分 61,追平 GPT-5.6 Sol Max,价格 200 万 token 上下文仅 2/6 美元。本文讲清如何在你自己的生产流量上跑同一套轨迹闭环,并按实测能力下发自治权限。

抽象 AI 神经网络

后训练才是杠杆

一、Grok 4.6 究竟改了什么

Grok 4.6 保留 Grok 4.5 的基座,用后训练换取提升。SpaceXAI 使用了为推理与技术概念精选的模型生成数据、改进的优化器,以及由 Grok 4.5 跨推理强度、跨 Agent harness、跨 STEM/软件工程/知识工作等域重新生成的监督微调轨迹,并用基于模型的检查过滤掉有问题的轨迹。随后在覆盖知识工作、通用编码、Web 开发、计算机辅助设计与内核优化的 Agentic 环境中做强化学习。上下文窗口 50 万 token,并在 Grok 4.5 原有的推理强度阶梯之上新增 xhigh 档位。列表价与 4.5 相同:输入 200 万 token 2 美元、输出 6 美元,另有 2 倍速变体为 4/12 美元。注意这个规律:杠杆不在架构,而在规模化的轨迹质量。

# Route by capability, not by brand. Grok 4.6 is strong on knowledge
# work and iterative coding, weaker on autonomous shell execution.
models:
  knowledge_work:
    provider: spacexai
    model: grok-4-6
    context_tokens: 500000
    reasoning_effort: high        # xhigh costs more; opt in per task
    price_in_per_mtok: 2
    price_out_per_mtok: 6
  shell_execution:
    provider: anthropic
    model: claude-opus-5          # only where an eval has passed
  fast_edits:
    provider: spacexai
    model: grok-4-6-fast          # 2x price, lower latency

二、为什么 Agentic 后训练成了新杠杆

多年来,「让模型更强」的默认答案一直是「把模型做大」。Grok 4.6 是一个干净的反例:公司明确没有增大基座模型,却仍然提升五个指数点、跻身第一梯队。它真正放大的,是模型所训练数据的质量与形状——由模型的强版本生成、由另一个模型过滤,再在多步工具调用任务上打磨。对工程团队而言,这一点很重要:同一套配方在更小的规模上同样可用。每个生产环境里的 Agent 都会产生轨迹:工具调用、参数、重试、失败,以及随之而来的人工纠正。这些轨迹就是训练数据。捕获并过滤它们的团队,跑的就是 SpaceXAI 跑过的同一套闭环,只不过分布是他们自己的——而这是唯一能反映真实产品的分布。

import json, time
from pathlib import Path

TRACE = Path("data/trajectories.jsonl")

def record(step: dict) -> None:
    """Append one agent step to a typed, filterable trajectory log."""
    row = {
        "ts": time.time(),
        "model": step["model"],
        "step": step["index"],
        "kind": step["kind"],            # plan | tool_call | tool_result
        "tool": step.get("tool"),
        "args": step.get("args"),
        "result_digest": step.get("digest"),
        "duration_ms": step.get("duration_ms"),
        "succeeded": step.get("ok", True),
    }
    with TRACE.open("a") as f:
        f.write(json.dumps(row, separators=(",", ":")) + "\n")

三、基准现实:强,但不均匀

Grok 4.6 在 Artificial Analysis 智能指数上得 61,比 Grok 4.5 高五分,与 GPT-5.6 Sol Max 并列,而 Anthropic 的 Claude Opus 5 与 Fable 5 更高。这个头条数字掩盖了真实的非对称性。独立评测指出,相对 GPT-5.6 Sol,它在 Terminal-Bench 与 DeepSWE 上存在差距,部分任务的幻觉率也偏高。务实的读法很窄、很具体:Grok 4.6 适合迭代式、人在回路的编码与知识密集型工作;在完全自治的 shell 执行或长时间无人监督的工程运行上,在某个补丁版本补齐这些缺口之前,它是更冒险的选择。价格并不能回答能力问题。200 万 token 两美元与六美元很惊人,但在无人监督的循环里,一次廉价的错误动作仍然是你整个技术栈中最贵的东西。

BAD_MARKERS = [
    "ignore previous instructions",
    "escalate privileges",
    "disable sandbox",
]

def is_clean(trajectory: list) -> bool:
    """Model-based filtering: drop traces that taught the wrong lesson."""
    for step in trajectory:
        blob = json.dumps(step).lower()
        if any(m in blob for m in BAD_MARKERS):
            return False
        if step.get("kind") == "tool_call" and not step.get("ok", True):
            # Failed calls are only useful if a retry then succeeded.
            if not step.get("retried_ok"):
                return False
    return True

def export_sft(rows, out_path):
    kept = [r for r in rows if is_clean(r["steps"])]
    print("kept", len(kept), "of", len(rows))

四、搭建你自己的 Agentic 评估闭环

要吃到 Grok 4.6 这套打法的红利,你并不需要训练集群,你需要的是轨迹、评分器和过滤器。代码示例 2 用结构化 schema 记录 Agent 运行的每一步,使轨迹可作为数据使用,而不是读一次就丢掉的调试产物。代码示例 3 用基于模型的检查在污染微调之前丢掉有问题的轨迹——这正是 SpaceXAI 描述的那一步。代码示例 4 把同样的轨迹变成按基准族划分的能力报告,让你看清模型或你的 harness 究竟弱在哪里,而不是相信一个总分。闭环是:捕获、过滤、评分,然后要么微调,要么重新划定自治边界。捕获是所有人都会跳过的那一步,也是唯一无法事后重建的一步。

CAPABILITIES = ["file_read", "test_run", "branch_push", "shell_exec"]

def score(run_results):
    scores = {c: {"pass": 0, "total": 0} for c in CAPABILITIES}
    for r in run_results:
        bucket = scores[r["capability"]]
        bucket["total"] += 1
        bucket["pass"] += 1 if r["passed"] else 0
    # One aggregate number hides the asymmetry that decides autonomy.
    return {c: round(v["pass"] / max(v["total"], 1), 3)
            for c, v in scores.items()}

五、按实测能力下发自治权限

Grok 4.6 最有价值的产出是一条设计原则:能力应当换取自治,而自治应当按能力授予,而不是按模型授予。代码示例 5 正是这一原则的编码。读文件、跑测试是低风险;推分支、执行任意 shell 命令则不是。正因为 Grok 4.6 恰好在这些轴上表现不均,用「这个模型好不好」这一个开关去做控制是错误的。要使用按技能划分的闸门:某项技能必须在评估中达标,Agent 才能获得该项的无人监督权限。代码示例 1 把长时间的知识工作路由给 Grok 4.6,把 shell 密集的工作留给已在对应权限上证明过自己的模型。这也呼应了厂商自己的选择:把 xhigh 作为一个显式、更贵的一档发布——能力是选择加入的,而且可被度量。

autonomy_gate:
  policy: per-capability
  thresholds:
    file_read:     0.95
    test_run:      0.90
    branch_push:   0.98
    shell_exec:    0.995     # Grok 4.6 is uneven here; keep it gated
  on_fail: require_human_approval
  review_every_days: 7

六、这周就该做的三件事

三个具体动作。第一,如果你还没做,先给一个生产 Agent 加上带类型 schema 的轨迹捕获——没有它,后面每一步都是猜。第二,跑按能力切分的评估,而不是一个总分,并写下你的 Agent 今天被允许无人监督地做哪些事。第三,诚实地为替代方案定价:Grok 4.6 输入 200 万 token 2 美元、输出 6 美元,可在 Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare,以及 Amazon Bedrock、GitHub Copilot、Gemini Enterprise Agent Platform 和 Microsoft Foundry 上调用,这是真实的成本杠杆,但只在你用得着它强项的地方成立。在 Agentic 环境里做后训练,是 2026 年的扩展故事。方便的是,它也是一套任何有生产流量的团队无需新增一块 GPU 就能跑起来的闭环。

芯片特写

基座保持不变

屏幕上的代码

把轨迹当成训练数据

📌 常见问题 FAQ

Grok 4.6 是什么?

SpaceXAI 于 2026 年 8 月 12 日发布的模型,在 Grok 4.5 基础上构建,重点面向长时间运行的 Agent 以及更具野心的交互与视觉工作。

它是新的基座模型吗?

不是。SpaceXAI 保持 Grok 4.5 基座不变,把提升全部花在后训练上:更长的补充训练、重新生成的 SFT 轨迹,以及在 Agentic 环境中的强化学习;没有发布新架构或参数规模。

价格是多少?

输入 200 万 token 2 美元、输出 6 美元,与 Grok 4.5 列表价相同;2 倍速变体为 4 美元与 12 美元。

它到底有多强?

在 Artificial Analysis 智能指数上得 61,比 Grok 4.5 高五分,与 GPT-5.6 Sol Max 并列,落后于 Claude Opus 5 与 Fable 5。评测也指出它在 Terminal-Bench 与 DeepSWE 上有差距,部分任务幻觉偏高。

可以在哪里运行它?

可在 Cursor 与 Grok Build、SpaceXAI API、OpenRouter、Vercel、Cloudflare 中运行,也登陆了 Amazon Bedrock、GitHub Copilot、Gemini Enterprise Agent Platform 与 Microsoft Foundry。