Anthropic 自曝 Claude 已主导 26% 的模型研发,并呼吁同行公开同类指标
2026年9月17日,Anthropic 在一份官方公告里给出了三组数字,把过去半年只在私下讨论的自我改进进度第一次写成了可以对比的量。第一组:Claude 目前主导公司 26% 的模型研究与开发。第二组:公司约 90% 的研发工作在与 Claude 的协作中完成。第三组:今年 2 月,Claude 主导的研发占比是零;到 8 月,它达到了四分之一。这三组数字放在一起,比任何一句关于通用人工智能还有多远的判断都更具体,因为它们描述的是实验室内部的日常分工是怎么变化的,而不是某项能力测试又涨了几个点。
26% 这个数字被 Anthropic 分成了两档含义,区分得相当小心。所谓 lead,指模型可以从一个高层提示出发,把一项任务端到端地做完大部分,但仍在人类监督之下;模型目前还做不到完全自主。剩下的约 90% 则属于 collaborate,Anthropic 的措辞是模型可以在密切的人类指导下完成大块工作。两档的区别不在模型的能力上限,而在人类是否还站在流程里面。把 lead 从 0% 走到 26% 只用六个月这件事,和 Anthropic 自己承认模型尚不能完全自主放在同一段话里,读起来并不轻松:一个实验室正在用六个月的时间,把原本属于人的那部分工作交出去四分之一。
这份公告出现的时间点,比数字本身更值得注意。就在一周多前,一位 Anthropic 研究员离职,并留下了关于这项技术对人类威胁的严厉警告,随后引发了新一轮关于是否应该给前沿模型的发展踩刹车的公开讨论。Anthropic 首席执行官 Dario Amodei 是呼吁放缓的主要声音之一。于是这份披露就带上了一层微妙的张力:公司一边在行业层面主张减速,一边在公告里如实报出自己内部自动化的进度。Anthropic 在配套博客文章里给出的解法是提高透明度,原文的说法是应该尽一切可能缩小前沿实验室知道的东西与公众知道的东西之间的差距,具体做法是更好地度量人工智能的发展、公开报告,并让社会有机会决定如何使用这些信息。换句话说,既然减速未必谈得成,那就先让外界看得见。
公告里还有两个容易被略过的数字。第一个是规模:截至 8 月,公司内约有 3 万个智能体在做研究与工程工作。这个数量级解释了为什么 Anthropic 要专门谈监督措施——只有当被监督对象有上万个的时候,监督系统发现异常行为的频率才具备统计意义,而单个智能体出错的概率再低,乘以三万也是一个日常事件。第二个是 Anthropic 承诺引入嵌入公司内部的外部第三方评估者,用于监督安全工作。把评估者放进公司里,比让它在外围写报告要重得多,也更难做,但它回答了一个具体的疑问:当模型开始参与开发下一代模型时,谁来判断这条曲线走得太快了。
这份披露没有回答的问题,可能和它回答的一样重要。公告没有说明 Anthropic 认为自己距离递归自我改进还有多远,也没有给出一个统一的判定标准。它真正给出的,是一个可以被别人复制的方法学:定义清楚 lead 和 collaborate 各自意味着什么,按固定节奏发布,让不同实验室的数字可以横向比较。这也是为什么 Anthropic 在公告里直接用呼吁同行公开同类指标收尾。读的时候需要保留一份谨慎:这些是公司自述的内部指标,外界没有独立核验的渠道,而 lead 与 collaborate 的边界由公司自己划定,语义上留有解释空间。把它当成一个开始记账的声明,比当成一张成绩单更贴近事实。
🤔 常见问题解答
Anthropic 说的 26% 具体是什么意思?
指 Claude 主导了公司 26% 的模型研究与开发工作。按 Anthropic 的定义,lead 意味着模型可以从一个高层提示出发、端到端完成一项任务的大部分,但仍在人类监督之下,目前尚未实现完全自主。
90% 的协作比例和 26% 的主导比例有什么区别?
26% 是模型主导完成的份额,约 90% 是模型参与其中的总份额,也就是 collaborate。Anthropic 对后者的描述是模型可以在密切的人类指导下完成大块工作。两者不是同一口径,不能相加或混用。
这条曲线的起点是什么时候?
2026 年 2 月,Claude 主导的研发占比为零;六个月后的 8 月达到四分之一。Anthropic 没有说明它认为距离递归自我改进还有多远,只表示模型加速自身开发会让人类更难理解或控制这些系统。
Anthropic 要求同行做什么?
用可公开比较的方法学、按固定节奏披露同类的模型开发指标。Anthropic 的论据是这样做有助于外界判断各前沿实验室离递归自我改进有多近,并承诺引入嵌入公司内部的外部第三方评估者监督安全工作。
🛠️ 推荐工具
- AI Token 计数器这篇文章的核心是把工作份额变成百分比。任何按量计费的大模型接口,实际账单都落在 token 上,先算清楚一段提示和一次回复各消耗多少,再谈成本才有着落
- 字数统计26% 与 90% 是两个不同口径的份额,很容易被混着引用。写材料时先把各段的字数、词数核一遍,比事后改口径省事
- Markdown 编辑器把实验室公告里的原始定义和数字整理成结构化的笔记,比散在浏览器标签页里可靠,半年后回头查那次发布的是哪一档口径也方便
总结
2026年9月17日,Anthropic 在官方公告中披露:Claude 主导公司 26% 的模型研究与开发工作,模型还不能完全自主,仍处于人类监督之下;约 90% 的研发在与 Claude 的协作中完成,即模型在密切人类指导下承担大块工作;这条曲线的起点是 2026 年 2 月的零,8 月达到四分之一。截至 8 月,公司内约有 3 万个智能体从事研究与工程工作。Anthropic 称模型加速自身开发会让人类更难理解或控制这些系统,主张更好地度量人工智能发展、公开报告,以缩小前沿实验室与公众之间的信息差,并呼吁其他开发者用可公开比较的方法学定期披露同类指标;公司同时承诺引入嵌入内部的外部第三方评估者监督安全工作。需要保留的谨慎是:这些均为公司自述的内部指标,无独立核验渠道,lead 与 collaborate 的边界由公司自行划定;公告未说明 Anthropic 认为距离递归自我改进还有多远。本文所有数据与说法均来自 AP 通讯社报道及 Anthropic 官方公告,无第三方推测内容。
来源链接:AP News: Anthropic says its model Claude is helping to build the next version of itself
Anthropic 官方新闻页(公告原文所在渠道)