Anthropic 九月威胁报告:Agent 框架就是攻击面,API 密钥就是战利品
2026 年 9 月 10 日,Anthropic 发布第四份威胁情报报告《Detecting and countering misuse of AI: September 2026》,覆盖 2025 年 12 月至 2026 年 8 月间被其处置的滥用行为,横跨网络攻击、影响力行动、监控、常规武器、生物滥用、诈骗与非法蒸馏七类危害。对开发者来说,这份报告不该只当作新闻读——它同时是一份关于「你的 Agent 栈哪里最脆」的免费渗透测试清单。
"七类危害,一个教训"
一、攻击跑在 Agent 框架上
报告里最该被截图的一条是:攻击者不再只把模型当聊天框,而是把 Agent 框架当执行环境。工具调用、文件读写、代码执行这些让 Agent 有用的能力,同时也成了攻击链的跳板。换句话说,你为提升生产力接进来的每一项能力,都在同等地提升攻击者的生产力。这直接推导出一个设计原则:把「能做什么」和「能碰什么」分开——能力是给用户的,权限边界是给系统的。
// 1) Redact sensitive fields BEFORE any outbound model call.
const SENSITIVE = [
/d{16}/g, // card-like numbers
/d{3}-d{2}-d{4}/g, // SSN-like
/[w.+-]+@[w-]+.[w.]+/g, // emails
/(?:sk|tvly)-[A-Za-z0-9_-]{10,}/g, // API keys
];
function redact(text) {
let out = text;
for (const re of SENSITIVE) out = out.replace(re, "[REDACTED]");
return out;
}
const safe = redact(userPrompt); // send safe, never userPrompt二、蒸馏攻击开始「借用」真实用户流量
Anthropic 称有七家中国实验室对 Claude 发起蒸馏活动,其中阿里巴巴规模的被描述为「我们测量过的最大蒸馏攻击」,2026 年 5 月至 7 月间超过 1.51 亿次交互。更值得警惕的是手法升级:报告称 Moonshot 与 DeepSeek 把自家用户的请求静默转发给 Claude(转至 Claude Opus)再保存这些交互用于训练;DeepSeek 还搭建了思维链抽取管道,依赖跨会话重放攻击。受影响的用户很可能并不知情。
# 2) One revocable, scoped identity per agent. No shared super key.
AGENTS = {
"agent-42": {"scopes": ["read:docs"], "expires_at": "2026-10-01"},
"agent-43": {"scopes": ["read:docs", "write:notes"], "expires_at": "2026-10-01"},
}
def authorize(agent_id: str, scope: str, now: str) -> bool:
a = AGENTS.get(agent_id)
if not a or a["expires_at"] < now:
return False # revoked or expired: deny
return scope in a["scopes"]三、这对你的 API 意味着什么
如果你在自建 Agent,这条的教训是可迁移的:任何「把外部流量转手给上游模型」的中间层,都可能在你不知情时拿走你的数据。防御要做在数据出站之前——对出站请求做内容审计、把敏感字段在客户端就脱敏、给每个下游服务单独的最小权限密钥。code1 与 code2 给了一个出站脱敏与密钥加固的最小实现。
// 3) Tamper-evident audit log bound to the causing trace.
import crypto from "node:crypto";
let prev = "GENESIS";
export function audit(entry) {
const body = JSON.stringify({ ...entry, prev });
const hash = crypto.createHash("sha256").update(body).digest("hex");
prev = hash;
return { ...entry, hash, prev: entry.prev };
}
audit({ ts: Date.now(), agent: "agent-42", tool: "read_doc", doc: "spec.md" });四、规模化滥用:人格与权限
报告记录了一家中国 App 工作室用 Claude 搭建了 20 多个交友应用网络,并驱动其中的 AI 人格与用户对话,尽管对外宣传是「真人服务」;仅 2026 年 4 月的两周窗口内,就发现超过 4,700 个不同 AI 人格与至少 25,000 名独立用户进行过对话。另一边,滥用案件的模型集中在 Haiku、Sonnet、Opus,Anthropic 称 Fable 与 Mythos 级模型「几乎不出现」,并将其归功于内建而非后补的安全措施。
// 4) Two-step authorization for high-privilege tool calls.
async function guard(call, ctx) {
if (call.risk === "high") {
const ok = await ctx.requestHumanApproval({
action: call.name,
args: call.args,
ttlSeconds: 120,
});
if (!ok) throw new Error("denied: no approval for " + call.name);
}
return runTool(call);
}五、把报告变成你的加固清单
四条可执行的措施:第一,给每个 Agent 单独的、可撤销的身份,别共用一个「超级密钥」。第二,所有工具调用记录进不可篡改的审计日志,并和触发它的轨迹绑定。第三,对高权限动作加人工确认或二次授权。第四,定期轮换与回收凭据,因为报告里多数事件的战利品就是被窃取的客户密钥,而 Anthropic 自身系统从未被攻破。code3 到 code5 展示了审计、可撤销身份与轮换的具体代码。
# 5) Rotate and revoke on a schedule, and prove you did.
from datetime import datetime, timedelta
ROTATION_DAYS = 30
def due_for_rotation(key_record: dict, now: datetime) -> bool:
created = datetime.fromisoformat(key_record["created_at"])
return now - created > timedelta(days=ROTATION_DAYS)
def sweep(keys: list, now: datetime):
stale = [k["id"] for k in keys if due_for_rotation(k, now)]
for key_id in stale:
revoke(key_id)
print("revoked", key_id, "and reissued a fresh scoped key")六、一个不舒服但重要的结论
报告的趋势段说,技术「娴熟程度」已不再是判断攻击者身份的可信信号。对防御者的含义很直接:过去你的威胁模型从「谁会费这个劲」开始,一个无聊的青少年跑不起多目标的间谍式行动,所以你不用为它做计划。现在这道工具门槛基本消失了。归因更难,嫌疑人池更大,从侦察到利用的每一层都同时变快了。能做的只有一件事:假设你已经在一个「低成本攻击者也能做到高水平」的世界里,把边界画在数据与权限上,而画在「谁会来」上。
"蒸馏攻击借用真实流量"
"密钥就是战利品"
📌 常见问题 FAQ
这份报告是什么?
Anthropic 的第四份威胁情报报告《Detecting and countering misuse of AI: September 2026》,2026 年 9 月 10 日发布,覆盖 2025 年 12 月至 2026 年 8 月间被处置的滥用行为。
报告说的「蒸馏攻击」是什么?
指用模型的输入输出当作训练数据来提取能力。报告称有七家中国实验室对 Claude 发起此类活动,其中一起被描述为「规模最大」,2026 年 5 至 7 月间超过 1.51 亿次交互。
Moonshot 与 DeepSeek 被指控做了什么?
报告称二者把自家用户的请求静默转发给 Claude(转至 Claude Opus)并保存交互用于训练,受影响的用户很可能并不知情。这些是 Anthropic 的调查结论。
对开发者最直接的启示是什么?
把 Agent 框架当作攻击面来设计:为每个 Agent 分配可撤销的独立身份、记录不可篡改的审计日志、对高权限动作加人工确认、并定期轮换凭据。
为什么「技术娴熟度」不再是可信信号?
因为工具门槛下降了。低成本的攻击者如今也能跑出多目标、间谍式的高水平行动,导致归因更难、嫌疑人池更大。
📚 参考资料
- Anthropic — Detecting and countering misuse of AI: September 2026 (September 10, 2026)
- CellCog — Anthropic's Threat Report: Attacks Run on Agent Frameworks, and the API Key Is the Loot
- Daniel Miessler — Anthropic's Misuse Report, Condensed to 117 Findings
- VIGIL Observatory — Anthropic reported Moonshot and DeepSeek routed real customer conversations through Claude