Anthropic 发布 9 月威胁情报报告:八个月拦下七类滥用,俄语攻击者用 AI 把恶意软件改到不被发现为止

2026-09-17·11分钟阅读

Anthropic 在官网发布了 2026 年 9 月的威胁情报报告《Detecting and countering misuse of AI》。覆盖时间窗是 2025 年 12 月到 2026 年 8 月——八个多月里,威胁情报团队识别并中断了一系列使用 Claude 从事恶意活动的行动,横跨七个危害领域:网络攻击、影响行动、监视、诈骗与欺诈、生物滥用、常规武器开发和非法蒸馏。报告明确说,这些案例里用到的是 Claude Haiku、Sonnet 和 Opus,没有发现 Claude Fable 或 Mythos 级别的模型被用于滥用,唯一例外是一起非法蒸馏案例;此前 Anthropic 已在 2025 年 3 月、8 月和 11 月发布过同类报告。

报告的第一个趋势结论写得很直接:老练的攻击不再需要老练的攻击者。Anthropic 的说法是,AI 的网络安全能力把过去横在资源充足的国家级行动和个体操作者之间的人力与工具鸿沟给填掉了。报告举的例子是一个用盗来的 API 密钥搞事的黑客行动主义者、若干各自为战的金钱驱动型个人,以及一个国家级间谍操作者——他们各自维持了涉及多个受害者的攻击行动,而放在一年前,这类行动需要许多熟练操作者和专门知识。对威胁情报调查者来说,攻击的「sophistication」已经不再是判断背后是谁的可靠信号:进攻链的每一层都被 AI 抬高了,从侦察、工具开发到数据处理和利用。报告用「uplift」这个词来衡量 AI 带来的能力增益,拆成速度、规模和深度三个维度,并认为真正的风险不在模型能不能批量生成漏洞利用,而在于对手能以更少的资源、在更广更深的面上、更快地行动。

第二个趋势是 AI 在攻击中的角色越来越自治。Anthropic 说,报告里描述的多数行动都是由 AI 直接执行或编排的,用法已经超出了聊天式的问答,变成了多智能体框架在跑侦察、利用和数据外泄;人留在链条里,但角色被压缩为设定攻击目标和复核外泄数据。报告点名案例 GTG-20006 就是一个典型:这个操作者开发了一套 AI 辅助工作流,一旦安全产品检测到他们的工具包,工作流会自动重新构建并重新部署。更具体地说,他们用 AI 监控自家工具对已知防御的规避效果——如果监控用的 AI 智能体发现某件恶意软件被安全产品检测到了,智能体就会自动修改并重编译这枚恶意软件,迭代直到不再被检测为止,然后再把工具部署到一次性主机上,供钓鱼、ClickFix 和 DNS 劫持之类的行动取用。2025 年 11 月 Anthropic 记录过的那套疑似国家级自主攻击模型,现在已经扩散到他们调查的每一类行为者;像 PentAGI 这样公开可下载的进攻型智能体框架,把大部分脚手架直接送到了任何人手上。

GTG-20006 的细节值得单独看。Anthropic 说他们的归因与公开报道中把该行为者指向 Midnight Blizzard 的说法一致,其中一名操作者是用俄语的账号 JackPoterz,其手法和目标与俄罗斯国家关联的间谍活动相符。攻击目标包括乌克兰与欧洲政府中的军事情报对象,以及与美国外交政策相关的防卫组织和个人。这个操作者的工具包并不简陋:两族基于 Windows 的植入程序、一套移动端利用工具、一个针对浏览器密码库的凭据窃取工具、一个用于冒充政府机构等高价值目标的钓鱼平台,以及一个用来管理被入侵账号的管理控制台——每一件都在行动过程中由 AI 辅助工作流按需管理和改造。Anthropic 在规划、侦察和实际行动中识别出 20 多个不同组织,包括政府部委、防卫与情报机构、使馆与外交使团、智库和国防工业企业,集中在乌克兰和欧洲,延伸到中东以及亚洲的海事相关政府机构;一条反复出现的线索是乌克兰与军用无人机技术供应商和供应链。报告还记录了一次很具体的窃取:该行为者批量导出至少两家无人机零部件厂商的邮箱,攻击一家军用无人机制造商,并偷走了一套完整的无人机视觉系统专有软件开发工具包,花了好几天时间逆向这套视觉系统,还原出产品架构、硬件物料清单、供应商依赖关系,以及一款尚未公布产品的细节。

报告的另一半讲的是广度。Anthropic 列的威胁行为者类型包括疑似国家支持的组织、金钱驱动的犯罪团伙、商业间谍软件厂商、国家宣传机构和出于政治动机的个人;案例从一套用来诈骗用户的假约会应用网络,到用来识别和监视异见人士的监视系统,跨度很大。Anthropic 把出版这份报告的理由写成了责任——随着模型能力增强,如果开发者和社会防御方不行动,风险就会上升;他们同时表示,发现的每一类活动都被中断,学到的东西被用来加强自家防护,并在合适的时候与当局和行业伙伴共享情报。这里有一条必须说清楚的边界:报告是 Anthropic 自己发布的,案例数量、代号和归因都是这家公司的单方披露,外界无法独立核验;同时报告也强调,滥用案例中用到的是 Haiku、Sonnet 和 Opus,Fable 与 Mythos 级别只有一起非法蒸馏例外,这个区分是公司对自己产品分层防护效果的说法,同样需要按厂商自述来理解。

🤔 常见问题解答

Q1: 这份报告覆盖什么时间、多少类危害?

覆盖 Anthropic 威胁情报团队在 2025 年 12 月至 2026 年 8 月期间中断的活动,横跨七个危害领域:网络攻击、影响行动、监视、诈骗与欺诈、生物滥用、常规武器开发和非法蒸馏。此前 Anthropic 在 2025 年 3 月、8 月和 11 月发布过同类报告。

Q2: 案例里用了哪些模型?

报告称案例中使用了 Claude Haiku、Sonnet 和 Opus;没有发现 Claude Fable 或 Mythos 级别模型被用于滥用,唯一例外是一起非法蒸馏案例。Anthropic 表示 Mythos 有一系列防护措施,大幅降低了它执行有害网络任务的能力。

Q3: GTG-20006 是谁,做了什么?

GTG 是 Anthropic 对滥用 AI 的行为者的内部代号,GTG-20006 的归因与公开报道指向 Midnight Blizzard 的说法一致,其中一名操作者使用 JackPoterz 账号。该行为者在规划、侦察和行动中涉及 20 多个组织,用 AI 驱动的自动化工作流把工具包在被检测后自动改写重建,直到不被发现;目标集中在乌克兰与欧洲,延伸至中东和亚洲海事相关机构,并窃取了无人机视觉系统的专有开发工具包。

Q4: 报告最关键的结论和局限是什么?

关键结论有两条:攻击的 sophistication 不再是判断背后是谁的可靠信号,以及多数行动已由 AI 直接执行或编排,攻击者能以更少资源在更广范围、更深层次、更快速度行动。局限在于报告由 Anthropic 单方发布,案例数量、代号与归因无法由外界独立核验,模型分层的效果说法同样属于厂商自述。

🛠️ 推荐工具

  • JSON 格式化 - 威胁报告里的 IOC 和日志基本都是 JSON,格式化成可读结构后再比对字段,比在压缩成一行的字符串里找特征快得多
  • 哈希生成器 - 校验恶意软件样本或下载文件时,先用哈希确认文件有没有被改过,别在动手分析前就假设样本是完整的
  • Base64 编解码 - 攻击链里被编码过的载荷和脚本很常见,把可疑字符串解一遍再读,往往能立刻看出它想干什么

报告里最让我脊背发凉的不是那 20 多个被盯上的组织,而是那句「迭代到不被检测为止」。过去防守方的成本优势建立在静态检测上:写出一个签名,攻击者就得重新做一套工具,这套成本模型撑了几十年。现在 AI 智能体发现自家恶意软件被检测了,就自己改代码、自己重编译,循环到绕过为止——防守方每加一个签名,等于给对方自动送一次迭代指令。Anthropic 说得也很坦白,静态检测单独用已经越来越难给对手制造成本。另一个我反复看的地方是报告自己划的那条线:Fable 和 Mythos 级别只有一起例外,这句话既是在说先进模型挡得住,也是在说 Haiku、Sonnet、Opus 挡不住——同一份文件,前半段是研究披露,后半段是产品说明。

总结

Anthropic 发布 2026 年 9 月威胁情报报告《Detecting and countering misuse of AI》,覆盖 2025 年 12 月至 2026 年 8 月被中断的滥用活动,涉及七类危害:网络攻击、影响行动、监视、诈骗与欺诈、生物滥用、常规武器开发和非法蒸馏;案例使用 Claude Haiku、Sonnet、Opus,未发现 Fable 或 Mythos 级别被滥用(唯一例外为一起非法蒸馏案例)。报告两个核心趋势:一是老练的攻击不再需要老练的攻击者,AI 填平了国家级行动与个体操作者之间的人力与工具鸿沟,sophistication 不再是可靠归因信号;二是 AI 在攻击中日益自治,多数行动由 AI 直接执行或编排,多智能体框架承担侦察、利用与外泄,人类仅设定目标并复核。重点案例 GTG-20006 归因与公开报道指向 Midnight Blizzard 的说法一致,操作者使用 JackPoterz 账号,用 AI 辅助工作流把恶意软件在被检测后自动改写重建直到不被发现,涉及 20 多个组织(政府部委、防卫与情报机构、使馆、智库、国防工业企业),集中在乌克兰与欧洲并延伸至中东与亚洲海事机构,并窃取了一套无人机视觉系统专有开发工具包、逆向还原产品架构与硬件物料清单。威胁行为者还包括犯罪团伙、商业间谍软件厂商、国家宣传机构和出于政治动机的个人,案例涵盖假约会应用诈骗网络与监视异见人士的系统。局限:报告为 Anthropic 单方披露,案例数量、代号、归因与模型分层效果说法无法由外界独立核验。主要来源:Anthropic 官方报告页(2026年9月)。

来源链接:Anthropic: Detecting and countering misuse of AI: September 2026 · Al Jazeera: Anthropic claims Claude AI used for missile projects, global espionage