Anthropic 九月威胁报告:Agent 框架就是攻击面,API 密钥就是战利品

·阅读约12分钟·Evergreen Tools Team

2026 年 9 月 10 日,Anthropic 发布第四份威胁情报报告《Detecting and countering misuse of AI: September 2026》,覆盖 2025 年 12 月至 2026 年 8 月间被其处置的滥用行为,横跨网络攻击、影响力行动、监控、常规武器、生物滥用、诈骗与非法蒸馏七类危害。对开发者来说,这份报告不该只当作新闻读——它同时是一份关于「你的 Agent 栈哪里最脆」的免费渗透测试清单。

"威胁情报"

"七类危害,一个教训"

一、攻击跑在 Agent 框架上

报告里最该被截图的一条是:攻击者不再只把模型当聊天框,而是把 Agent 框架当执行环境。工具调用、文件读写、代码执行这些让 Agent 有用的能力,同时也成了攻击链的跳板。换句话说,你为提升生产力接进来的每一项能力,都在同等地提升攻击者的生产力。这直接推导出一个设计原则:把「能做什么」和「能碰什么」分开——能力是给用户的,权限边界是给系统的。

// 1) Redact sensitive fields BEFORE any outbound model call.
const SENSITIVE = [
  /d{16}/g,                 // card-like numbers
  /d{3}-d{2}-d{4}/g,     // SSN-like
  /[w.+-]+@[w-]+.[w.]+/g,     // emails
  /(?:sk|tvly)-[A-Za-z0-9_-]{10,}/g, // API keys
];

function redact(text) {
  let out = text;
  for (const re of SENSITIVE) out = out.replace(re, "[REDACTED]");
  return out;
}
const safe = redact(userPrompt);   // send safe, never userPrompt

二、蒸馏攻击开始「借用」真实用户流量

Anthropic 称有七家中国实验室对 Claude 发起蒸馏活动,其中阿里巴巴规模的被描述为「我们测量过的最大蒸馏攻击」,2026 年 5 月至 7 月间超过 1.51 亿次交互。更值得警惕的是手法升级:报告称 Moonshot 与 DeepSeek 把自家用户的请求静默转发给 Claude(转至 Claude Opus)再保存这些交互用于训练;DeepSeek 还搭建了思维链抽取管道,依赖跨会话重放攻击。受影响的用户很可能并不知情。

# 2) One revocable, scoped identity per agent. No shared super key.
AGENTS = {
    "agent-42": {"scopes": ["read:docs"], "expires_at": "2026-10-01"},
    "agent-43": {"scopes": ["read:docs", "write:notes"], "expires_at": "2026-10-01"},
}

def authorize(agent_id: str, scope: str, now: str) -> bool:
    a = AGENTS.get(agent_id)
    if not a or a["expires_at"] < now:
        return False                     # revoked or expired: deny
    return scope in a["scopes"]

三、这对你的 API 意味着什么

如果你在自建 Agent,这条的教训是可迁移的:任何「把外部流量转手给上游模型」的中间层,都可能在你不知情时拿走你的数据。防御要做在数据出站之前——对出站请求做内容审计、把敏感字段在客户端就脱敏、给每个下游服务单独的最小权限密钥。code1 与 code2 给了一个出站脱敏与密钥加固的最小实现。

// 3) Tamper-evident audit log bound to the causing trace.
import crypto from "node:crypto";

let prev = "GENESIS";
export function audit(entry) {
  const body = JSON.stringify({ ...entry, prev });
  const hash = crypto.createHash("sha256").update(body).digest("hex");
  prev = hash;
  return { ...entry, hash, prev: entry.prev };
}
audit({ ts: Date.now(), agent: "agent-42", tool: "read_doc", doc: "spec.md" });

四、规模化滥用:人格与权限

报告记录了一家中国 App 工作室用 Claude 搭建了 20 多个交友应用网络,并驱动其中的 AI 人格与用户对话,尽管对外宣传是「真人服务」;仅 2026 年 4 月的两周窗口内,就发现超过 4,700 个不同 AI 人格与至少 25,000 名独立用户进行过对话。另一边,滥用案件的模型集中在 Haiku、Sonnet、Opus,Anthropic 称 Fable 与 Mythos 级模型「几乎不出现」,并将其归功于内建而非后补的安全措施。

// 4) Two-step authorization for high-privilege tool calls.
async function guard(call, ctx) {
  if (call.risk === "high") {
    const ok = await ctx.requestHumanApproval({
      action: call.name,
      args: call.args,
      ttlSeconds: 120,
    });
    if (!ok) throw new Error("denied: no approval for " + call.name);
  }
  return runTool(call);
}

五、把报告变成你的加固清单

四条可执行的措施:第一,给每个 Agent 单独的、可撤销的身份,别共用一个「超级密钥」。第二,所有工具调用记录进不可篡改的审计日志,并和触发它的轨迹绑定。第三,对高权限动作加人工确认或二次授权。第四,定期轮换与回收凭据,因为报告里多数事件的战利品就是被窃取的客户密钥,而 Anthropic 自身系统从未被攻破。code3 到 code5 展示了审计、可撤销身份与轮换的具体代码。

# 5) Rotate and revoke on a schedule, and prove you did.
from datetime import datetime, timedelta

ROTATION_DAYS = 30

def due_for_rotation(key_record: dict, now: datetime) -> bool:
    created = datetime.fromisoformat(key_record["created_at"])
    return now - created > timedelta(days=ROTATION_DAYS)

def sweep(keys: list, now: datetime):
    stale = [k["id"] for k in keys if due_for_rotation(k, now)]
    for key_id in stale:
        revoke(key_id)
        print("revoked", key_id, "and reissued a fresh scoped key")

六、一个不舒服但重要的结论

报告的趋势段说,技术「娴熟程度」已不再是判断攻击者身份的可信信号。对防御者的含义很直接:过去你的威胁模型从「谁会费这个劲」开始,一个无聊的青少年跑不起多目标的间谍式行动,所以你不用为它做计划。现在这道工具门槛基本消失了。归因更难,嫌疑人池更大,从侦察到利用的每一层都同时变快了。能做的只有一件事:假设你已经在一个「低成本攻击者也能做到高水平」的世界里,把边界画在数据与权限上,而画在「谁会来」上。

"矩阵与数据"

"蒸馏攻击借用真实流量"

"服务器机房"

"密钥就是战利品"

📌 常见问题 FAQ

这份报告是什么?

Anthropic 的第四份威胁情报报告《Detecting and countering misuse of AI: September 2026》,2026 年 9 月 10 日发布,覆盖 2025 年 12 月至 2026 年 8 月间被处置的滥用行为。

报告说的「蒸馏攻击」是什么?

指用模型的输入输出当作训练数据来提取能力。报告称有七家中国实验室对 Claude 发起此类活动,其中一起被描述为「规模最大」,2026 年 5 至 7 月间超过 1.51 亿次交互。

Moonshot 与 DeepSeek 被指控做了什么?

报告称二者把自家用户的请求静默转发给 Claude(转至 Claude Opus)并保存交互用于训练,受影响的用户很可能并不知情。这些是 Anthropic 的调查结论。

对开发者最直接的启示是什么?

把 Agent 框架当作攻击面来设计:为每个 Agent 分配可撤销的独立身份、记录不可篡改的审计日志、对高权限动作加人工确认、并定期轮换凭据。

为什么「技术娴熟度」不再是可信信号?

因为工具门槛下降了。低成本的攻击者如今也能跑出多目标、间谍式的高水平行动,导致归因更难、嫌疑人池更大。