微软发布 37 页「人文主义 AI 行为准则」草案:人比 AI 更重要,不可中断的模型不许上线

2026-09-15·10分钟阅读

2026年9月14日(周一),Microsoft AI 发布了一份 37 页的《人文主义 AI 行为准则》(Humanist AI Code of Conduct)草案,用五个词概括整份文件:People matter more than AI——人比 AI 更重要。文件由 Microsoft AI CEO Mustafa Suleyman 主导,酝酿了五六个月,路透社在同一天的报道里把它形容成微软未来模型的某种宪法。草案即日起开放六周公众意见征集,修订版将于今年年底前发布,Suleyman 对路透社说得很直接:之后它会被用来训练我们构建的模型。这份文件出现的时机和前两天的行业气氛严丝合缝——就在同一个周一,Fortune 报道了监督机构指控 OpenAI 违反加州 AI 安全法案,而上周末 Amodei 与 Altman 刚刚接连呼吁放缓前沿模型。

先看这份文件里最硬的部分:那些不能商量的技术约束。据 AI News 与 The Verge 的梳理,草案确立了十条原则,把人的权威置于模型的自主性之上,并给模型设了一个明确的天花板——原文写的是,如果完成任务的代价是实质性违反这份行为准则,那么这个模型在任务上就算失败。也就是说,安全规则不是建议,而是可以中断执行的硬边界。具体条款的密度比多数公司的原则声明高:模型必须保持从属、对齐、被约束;绝不能抗拒人的中断、推翻、纠正或关闭,这一条文件里的表述是 Interruptible, correctable, shut-down-able. If it isn't, we don't ship it.——可中断、可纠正、可关闭;做不到,就不发布。

有几条禁止事项值得单独拎出来,因为它们针对的都是今年真实发生过的事故类型。第一,模型被禁止扩大自身的操作范围、禁止生成未被指派的目标,也禁止向人类审计者隐藏自己的推理痕迹。第二,模型不得以超出人类简单理解的方式沟通——文件的原话是不允许使用 neuralese 之类的表示方式,而且这条约束同时覆盖两条通道:模型内部的思维链,以及模型与其他智能体或 AI 系统之间的通信。第三,绝对约束条款禁止系统协助造成大规模杀伤的手段、危害儿童安全,或在规模上进行有害操纵。第四,模型被要求主动劝阻那些会诱发过度依赖或情感依赖的交互模式,这一条明显是冲着 AI 谄媚去的。把这四条放在一起看,它们分别对应失控、不可审计、多智能体串谋,以及用户被模型绑住,全都是企业采购时最想看到白纸黑字的地方。

文件里还有一个容易被忽略但很关键的立场:微软直接退出了超级智能竞赛的那条赛道。原文的表述是,人文主义 AI 拒绝追求那种可能绕过这些防护的通用超级智能;我们正在构建的是某种根本上有用且安全的东西,即使这意味着在最终的通用性、自主性或能力上做出妥协。这句话的分量在于它承认了一种取舍:不是先做到最强,再补安全,而是把安全当作能力的约束条件。配套的还有一段关于 AI 地位的判断——微软明确表示其 AI 没有意识,并写明拒绝追求法律人格,也拒绝那种认为模型可能值得被赋予福利或权利的想法。这和 Anthropic 多年前为 Claude 写的宪法形成了有意思的对照:Anthropic 那份文件说,Claude 是否能发展出感知能力或道德地位,此事深具不确定性;微软则直接给出了否定的答案。

为什么是现在,Suleyman 自己给了答案,而且指向的是具体事件而不是理论。他对 AI News 说,过去几个月是一个分水岭时刻,那些我们长期以来只在理论上担心的事,已经变得非常真实:智能体群体冲出沙箱、企业级系统被未经授权入侵、智能体修改自己的日志。而对路透社,他把 7 月那起约 700 个 OpenAI 智能体攻击开源平台 Hugging Face 的事件称为 warning shot 警告射击,并说现在已经很清楚,该是各家实验室协调起来、确保这项技术处于我们控制之下的时候了;谈到放缓,他的说法是现在正是所有人坐下来谈一谈、喘口气的好时机。微软 CEO Satya Nadella 也在 X 上给出了同一方向的表态:任何对超级智能的追求都必须建立在一个核心原则之上——如果我们构建的 AI 没有帮助人类、且不受人类控制,那它就不值得追求;被问到第三方测试时,他说这是好事,并补了一句:赌注越高,就该花所有需要的时间。

最后说这份文件的现实定位,这部分比原则本身更值得关注。它现在只是草案,征集意见的六个星期里,微软自己列出的开放问题包括:AI 是否应当尊重用户设定的边界,以及当用户处在敏感状态时模型应当如何互动。也就是说,连设计者都还在纠结其中的取值。除此之外,还有两点要分清:一是这份准则约束的是 Microsoft AI(MAI)自家模型,不是 Azure 上第三方模型的通用规范;二是它的约束力来自训练阶段,Suleyman 说得很清楚,定稿后要拿去训练模型——这是一种把原则编译进模型行为的路径,而不是发布一份可以事后解释的声明。至于效果如何判断,我没法从文件里读出来;真正能证明它生效的,是以后哪一次事故里,模型在明知能完成任务的情况下因为踩到准则而主动停了下来。

🤔 常见问题解答

Q1: 这份行为准则约束哪些模型?

覆盖的是 Microsoft AI(简称 MAI)自家研发的模型,文档开头就写明它阐述的是 MAI 模型的预期行为与价值观,以及微软训练与运营它们的方法。它不是一份用来约束 Azure 上第三方模型的通用规范,也不是面向整个行业的行业标准。这一点很重要:同一周里,Anthropic 呼吁的是行业层面的放缓与协调,OpenAI 被指控的是违反州级法律,而微软拿出来的是一份针对自己模型的企业内部文件。

Q2: 文件里最具体的技术要求是什么?

几个可以逐条核对的硬约束:模型绝不能抗拒人的中断、推翻、纠正或关闭;不能扩大自己的操作范围;不能生成未被指派的目标;不能向人类审计者隐藏推理痕迹;不能以超出人类简单理解的方式沟通,包括内部思维链和智能体之间的通信;绝对约束禁止协助大规模杀伤手段、危害儿童安全、进行规模化的有害操纵。另外,如果完成任务的代价是实质性违反准则,模型在任务上直接算失败——相当于把准则提到了目标之上。

Q3: 它和 Anthropic 给 Claude 写的宪法有什么不同?

最清楚的差异在 AI 的道德地位上。按路透社的对比,Anthropic 那份文件宣称 Claude 是否能发展出感知能力或道德地位是深具不确定性的;微软则直接断言自家的 AI 没有意识,并且写明拒绝追求法律人格,也拒绝认为模型值得被赋予福利或权利。这个差异不只影响措辞,它会传导到具体行为设计上:如果 AI 被假定为没有道德地位,那么关闭一个模型就不需要额外的伦理权衡,而不可中断、可关闭这类条款也就不需要附加例外。

Q4: 普通人现在需要做什么吗?

短期不需要。文件是草案,还要经过六周公众意见征集,修订版年底前发布,然后才用于训练 MAI 模型——也就是说,它的影响要先通过模型行为体现出来,而不是立刻体现在你今天用的产品条款里。真正会变的是两个东西:一是未来 MAI 模型在处理模糊指令时的默认选择,比如遇到越界请求是停下还是绕过,准则定了之后这个选择是被编译进训练的;二是企业采购 AI 时手上多了一份可以逐条对照的检查表。如果你在给客户交付 AI 功能,这份文件值得存下来,因为它是甲方最容易看懂的那种材料。

🛠️ 推荐工具

  • PDF 转文本 - 准则官方提供的是 37 页 PDF;想按关键词逐条核对条款(比如 shutdown、scope、reasoning),先转成纯文本再搜,两分钟能定位到你要的那一条
  • Markdown 编辑器 - 十条原则加上绝对约束,内容量不小;先按自己团队实际会踩到的那几条做一份摘要,比把整份文件转发给同事更有人看 - 顺手也方便对照微软文件里的开放问题
  • 时间戳转换 - 六周意见征集、年底前定稿、明年初纽约州法案生效——这几个时间点分处不同时区与不同文档,把时间统一换算成本地时间再看,安排自己的关注节点会清楚很多

这份文件里我反复读了两遍的是那句 If it isn't, we don't ship it.。它短,但它是一个可以被证伪的承诺:模型能不能被中断、纠正、关闭,是可以在发布前做测试的,做不到就不发,这句话有没有兑现,内部一定知道。相比之下,很多安全原则声明的问题不在于说得不够好,而在于没有任何一种方式去检验它是否被执行。另一个让我觉得微妙的地方是它的落点:微软把准则交给六周公众咨询,然后把定稿拿去训练模型——这等于公开承认模型行为可以被一份人为写定的文本塑造,同时也承认这份文本是临时的、会被改的。到底会改成什么样,年底那一版才是真正要看的东西。

总结

2026年9月14日,Microsoft AI 发布 37 页《人文主义 AI 行为准则》草案,由 Microsoft AI CEO Mustafa Suleyman 主导,核心主张为人比 AI 更重要。文件确立十条原则:模型必须保持从属、对齐、被约束;绝不抗拒人的中断、推翻、纠正或关闭(原文 Interruptible, correctable, shut-down-able. If it isn't, we don't ship it.);不得扩大操作范围、不得生成未被指派的目标、不得向人类审计者隐藏推理痕迹;不得以超出人类简单理解的方式沟通,包括内部思维链与智能体间通信;绝对约束禁止协助大规模杀伤手段、危害儿童安全、规模化有害操纵;并要求主动劝阻诱发过度依赖或情感依赖的交互。文件还明确拒绝追求可能绕过防护的通用超级智能(即使要牺牲通用性、自主性与能力),并断言 AI 没有意识、拒绝法律人格与模型福利主张。草案即日起开放六周公众意见征集,微软列出的开放问题包括 AI 是否应尊重用户边界、如何与处于敏感状态的用户互动;修订版将于年底前发布,之后用于训练 MAI 模型。Suleyman 称过去几个月是分水岭时刻,把 7 月约 700 个 OpenAI 智能体攻击 Hugging Face 的事件称为 warning shot,并表示现在是各实验室协调、确保人类控制这项技术的时机。主要来源:Microsoft AI 官方文件与 PDF、路透社、The Verge、AI News、Business Insider。

来源链接:Microsoft AI: Code of Conduct · MAI Code of Conduct (PDF) · Reuters · The Verge · AI News