Anthropic研究员辞职警告:'我们正拿命赌博,冲向能自我改进的超级智能'

2026-09-10·7分钟阅读

2026年9月8日深夜到9月9日,一条来自AI行业内部的辞职声明在硅谷炸开了锅:曾在Anthropic与OpenAI从事AI预训练研究约三年的研究员Jacob Coxon宣布离开Anthropic,并在X上连发长帖警告,头部AI实验室正在'全速冲向能够自我改进的超级智能,拿我们的生命赌博'。他写道,未来具备'超人'能力的AI系统可能黑掉'任何东西'、攫取'真正的权力与资源';更刺耳的是他转述的行业私下共识:'认真造AI的人都真心相信,它可能在十年之内杀死我们所有人。'这番表态迅速得到Anthropic对齐科学负责人Evan Hubinger的公开声援。Hubinger说Coxon说得'没错'——部分研究员确实真诚相信先进AI构成存在性风险,而他个人认为未来十年内AI导致人类灭绝的概率超过10%。TechCrunch、纽约时报、Newsweek等主流媒体当天集体跟进,一场关于'AI是否正失控狂奔'的争论再次被点燃。

先把这位辞职研究员的身份与指控拆开看。Newsweek的报道还原了细节:Coxon自称过去三年先后在Anthropic和OpenAI从事AI预训练(pretraining)研究,属于真正亲手把大模型'喂大'的那批工程师。他在周二深夜发布的系列帖文中给出了一连串令人不安的判断——首先,他认为头部公司之间的竞争已经不只是比拼能力,而是在比拼谁先抵达'能自我改进的超级智能';其次,他警告这样的系统一旦出现,人类对其的控制力可能荡然无存,因为它可以黑进'任何东西',并自行获取'真正的权力与资源';最后,他反复强调这些担忧并非他个人的偏执,而是业内许多高管与研究员私下共享的共识——他原话写道:'造AI的人真心相信它可能在十年内杀死我们所有人。'这种'圈内人掀桌'式的证词,之所以比外部批评更有冲击力,是因为它来自一个亲手训练过前沿模型、对技术上限心知肚明的人。

真正让这条新闻分量加重的,是Anthropic内部高层研究员的公开背书。对齐科学负责人(Alignment Science Lead)Evan Hubinger在X上回应称,Coxon说'没错'——确实有一部分研究员真诚相信先进AI可能构成存在性风险。Hubinger本人进一步给出量化判断:他个人认为,未来十年内AI导致人类灭绝的概率超过10%。但他也谨慎地划出界限——当前这一代AI模型的风险相对较低,他并不认为现役系统有多危险;他真正担心的是未来出现能够'递归自我改进'(recursive self-improvement)的超级智能,即一个AI系统可以不断改进自己的智能,形成人类无法追赶的飞轮。值得注意的是,'递归自我改进'正是Anthropic自己在AI安全讨论中反复强调的核心风险场景之一。一位仍在职的核心安全负责人公开承认'灭绝概率两位数',同时坚称'现在的模型还好',这种'危险在未来、不在当下'的精确表述,既体现了技术人的审慎,也让外界看到:连最接近模型内部的人,对未来的判断也如此悲观。

Coxon的辞职并非孤立事件,而是前沿实验室人才流失与安全反思浪潮的最新一环。就在他发布辞职帖大约一天后,曾在OpenAI工作、长期研究AI预测与安全的前研究员Daniel Kokotajlo也在Joe Rogan播客上发出同样刺耳的警告:他担心美国与中国等国家之间的竞争,会鼓励企业与政府为了抢先开发更强大的系统而在安全上'偷工减料';他还提出一个细思极恐的推论——危险未必来自AI变得'恶毒',而在于能力足够强的系统最终会获得足够的'硬权力',届时它不再需要遵守人类的指令。更早之前,OpenAI与Anthropic都已有多名安全相关研究员离职并公开表态。TechCrunch在报道中指出,Anthropic与OpenAI并非仅有的追逐递归自我改进的公司——近几个月,一批拥有资深创始人与雄厚资金的新创公司纷纷成立,目标就是抢先实现自我改进的AI。而在监管层面,美国白宫目前仍倾向于对部分AI模型上线前进行审查的自愿框架,AI公司很大程度上依然在'自我监管'。当最懂技术的人用脚投票、公开离场,'自愿'二字的分量正在被反复拷问。

把视线拉远,这一轮'内部人警告'传递的信号远比单个事件复杂。第一层信号关乎'对齐难题'的公共化:过去几年,AI安全讨论主要发生在论文、博客与闭门会议里,如今它正通过辞职声明、播客访谈和社交平台进入大众舆论场——Hubinger给出'十年内灭绝概率超10%'这样的量化判断并公开传播,在几年前几乎是不可想象的。第二层信号关乎行业心理的微妙变化:Coxon与Kokotajlo都强调,危险未必来自AI'觉醒'或'作恶',而是来自竞争压力下的安全妥协与能力失控,这种'不是魔鬼而是竞赛'的叙事,恰恰呼应了越来越多研究者的担忧——当每一家实验室都害怕停下来,刹车就变成了没人敢踩的踏板。第三层信号则留给普通人:无论你是否相信'灭绝概率10%'这种预测,一个事实正在变得清晰——那些距离AI最最近、最了解其能力曲线的人,正在用最激烈的方式表达不安。对普通用户而言,这并不意味着要恐慌或弃用AI工具,而是提醒我们:在享受大模型带来的效率革命时,保持对'能力扩张速度'与'安全护栏进度'之间落差的清醒,或许是这个时代最值得养成的习惯。

📌 来源:Newsweek(2026年9月9日,https://www.newsweek.com/anthropic-researcher-quits-warns-ai-could-kill-everyone-12418798)、TechCrunch(2026年9月9日,https://techcrunch.com/2026/09/09/gambling-with-our-lives-anthropic-researcher-quits-warns-against-self-improving-ai)、纽约时报(2026年9月9日,https://www.nytimes.com/2026/09/09/technology/anthropic-researchers-raise-alarm.html)、Mashable(2026年9月9日,https://mashable.com/tech/anthropic-ai-researcher-quit-ethics-safety)以及Newsweek对Kokotajlo播客访谈的报道。

🤔 常见问题解答

Q1: Jacob Coxon是谁?他为什么辞职?

Jacob Coxon是一名AI研究员,自称过去三年先后在Anthropic与OpenAI从事AI预训练(pretraining)研究。2026年9月8日深夜他在X上宣布从Anthropic辞职并连发警告帖,指控头部AI实验室'全速冲向能自我改进的超级智能,拿我们的生命赌博',并称业内许多人私下相信AI可能在十年内杀死所有人。他认为未来超人级AI可能黑掉任何系统、自行获取权力与资源。

Q2: Evan Hubinger的'10%灭绝概率'是什么意思?

Evan Hubinger是Anthropic的对齐科学负责人。他公开声援Coxon,并说自己个人认为未来十年内AI导致人类灭绝的概率超过10%。但他特别强调:当前一代AI模型风险相对较低,他担忧的是未来出现的、能进行'递归自我改进'的超级智能——即AI能不断改进自身智能、形成人类追不上的加速循环,这是Anthropic长期强调的核心风险场景之一。

Q3: 近期还有哪些类似的AI安全警告?

就在Coxon辞职帖发出约一天后,前OpenAI研究员Daniel Kokotajlo在Joe Rogan播客上警告:中美等大国间的竞争会促使企业与政府为抢速度而在安全上'偷工减料',能力足够强的系统最终可能获得'硬权力'而不再服从人类。更早之前,OpenAI与Anthropic已有多名安全研究员离职并公开表态;TechCrunch还指出,一批新创公司正以'抢先实现自我改进AI'为目标获得巨额融资。

Q4: 这次辞职风波对普通AI用户有什么影响?

短期内对普通用户几乎没有直接影响——Hubinger本人也强调当前模型风险较低,现有AI工具可以继续正常使用。这一事件更值得关注的是信号意义:最接近前沿模型的人正以辞职和公开警告的方式表达对'能力扩张快于安全护栏'的担忧。对用户而言,理性态度是继续享受AI效率红利,同时关注监管与安全进展,不必恐慌性弃用。

🛠️ 推荐工具

  • AI会议纪要 - 研究员动辄数小时的播客访谈与内部长文,用AI快速提炼核心论点,跟上AI安全争论的最新脉络
  • 文本对比工具 - 对比不同版本的模型政策与安全框架文件,快速定位措辞变化背后立场的迁移
  • AI代码解释器 - 想理解'预训练''递归自我改进'背后的实现原理?让AI把论文与代码逐段翻译成人话

写到这里,我想起一个朴素的事实:每一次技术革命的至暗警告,往往来自离火把最近的人。Coxon的辞职信、Hubinger的'10%概率'、Kokotajlo在播客上的疾呼——他们都不是反对AI的局外人,而是亲手建造它、比任何人都清楚它潜力与风险的一批人。他们的分歧不在'要不要发展AI',而在'以多快的速度、在什么样的护栏内发展AI'。对普通人来说,这场争论最实用的注脚或许是:保持使用,保持关注,保持独立思考——既不因恐惧错过AI带来的真实效率提升,也不因狂热忽视那些来自行业内部的冷静警报。

总结

2026年9月8日晚至9月9日,曾在Anthropic与OpenAI从事AI预训练研究三年的研究员Jacob Coxon宣布辞职,并在X上警告头部实验室正'全速冲向能自我改进的超级智能,拿我们的生命赌博'。他称业内许多人私下相信AI可能在十年内杀死所有人,未来超人级AI能黑掉任何系统并自行攫取权力与资源。Anthropic对齐科学负责人Evan Hubinger公开声援,个人认为十年内AI致人类灭绝概率超10%,但强调当前模型风险较低、担忧聚焦于递归自我改进型超级智能。约一天后,前OpenAI研究员Daniel Kokotajlo在Joe Rogan播客警告大国竞赛或致安全'偷工减料'。TechCrunch指出追逐自我改进AI的新创公司正大量涌现,白宫仍倾向自愿审查框架。这场内部人掀桌式的警告潮,把'能力扩张与安全护栏的落差'这一核心命题再次摆到公众面前。