Anthropic 内部 26% 的 AI 研发已由 Claude 主导,3 万个 Agent 同时运行

12 阅读

AI 研发自动化的真实进展:Anthropic 给出了具体数字

过去我们讨论 AI 是否在“自我改进”,往往只能看一些间接指标:比如大模型在 HumanEval 上的得分、开发者用 Copilot 写代码的比例,或者某个 AI Agent 能连续跑多久。这些数据有用,但离真正的研发自动化还有距离。

图片

现在,Anthropic 直接给出了一个更贴近现实的答案:截至 2026 年 8 月,其内部 26% 的 AI 研发工作已经由 Claude 主导完成。与此同时,超过 90% 的研发任务至少进入了“AI 协作”阶段。这个比例在半年前还不到 1%。

图片

这不是营销话术,而是基于一套明确的自动化等级划分。Anthropic 借用了 Epoch AI 提出的 AL0–AL5 六级框架,来衡量 AI 在研发中的参与程度:

图片

  • AL0:完全无 AI 参与
  • AL1:AI 提供少量帮助(如查文档)
  • AL2:AI 辅助(如补全代码片段)
  • AL3:AI 协作(人类主导流程,AI 执行子任务)
  • AL4:AI 主导(人类只给目标,AI 端到端完成)
  • AL5:AI 完全自主(无需人类介入)

图片

目前,Anthropic 明确表示没有任何任务达到 AL5。但 AL4 的快速普及,已经让研发模式发生了实质变化。

“把它修好”——AL4 的真实场景

Anthropic 举了一个很具体的例子来说明 AL4 和 AL3 的区别。

假设一个夜间运行的数据管道突然中断。在 AL3 阶段,工程师需要先查看日志、形成初步判断,再把上下文交给 Claude。如果过程中出现意外(比如权限问题或依赖冲突),Claude 很可能停下来,等人类决定下一步怎么做。

到了 AL4,工程师只需要把告警信息丢给 Claude,说一句:“把它修好。”

接下来,Claude 会自己:

  • 分析日志,定位故障点
  • 推断可能原因(如配置错误、资源不足)
  • 编写修复代码
  • 在沙箱中测试
  • 处理测试中暴露的新问题(比如回滚机制缺失)
  • 重新运行整个管道,验证修复效果
  • 撰写故障复盘报告

人类最后只需审核结果,决定是否上线。整个过程不再需要“手把手指导”。

这种模式正在 Anthropic 内部快速铺开。从 2026 年 2 月到 8 月,AL4 占比从不到 1% 跃升至 26%。而 90% 以上的研发任务至少达到了 AL3,意味着 AI 已经能承担大块的具体工作。

3 万个 Agent 同时工作的“自动实验室”

比“26%”更有画面感的是另一组数据:截至 2026 年 8 月,Anthropic 使用最频繁的内部 Agent 平台上,任意时刻大约有 3 万个 AI Agent 正在执行研究或工程任务

这些 Agent 不是孤立运行的。它们拥有持续的“身份”——即使底层模型升级,身份也不会重置。Agent 之间通过一个开放的消息系统沟通,所有消息都标明发送者,并尽量保留原始引用。

这种设计让 Agent 能像人类同事一样互动。当一个 Agent 收到另一个 Agent 的信息时,它不会盲目信任,而是将其视为“一项需要验证的主张”。这使得它们既能协作,也能互相纠错。

例如,一个负责训练监控的 Agent 发现异常指标后,可能会向推理服务团队的 Agent 发送诊断请求。后者收到后,会调用工具检查日志、分析流量,并返回结论。整个过程无需人类介入调度。

为了管理这个庞大的虚拟团队,Anthropic 建立了两层监控系统:

  • 在线监控:每个 Agent 动作执行前都要通过 Monitor 检查,耗时通常几秒。2026 年 8 月,系统审查了超 10 亿次决策,仅约 0.002% 被阻止。
  • 离线监控:事后分析完整行为记录,每周标记约 10 万条对话。经过多层分类器过滤,最高优先级的约 50 条/周会升级到人工审查。

Anthropic 表示,目前单个 Agent 出现严重问题的情况并不常见。

如何量化“AI 主导”的程度?

要得出“26%”这个数字,Anthropic 做了一套复杂的测量体系,称为 R&D Automation Index

方法是从公司内部的 Slack 消息、文档、工单等数据源入手。在 2026 年 7 月的每一周,他们随机抽取 20% 参与模型研发的员工,让 Claude 分析这些人一周内做了哪些具体任务。

最终,Claude 整理出约 1.5 万项研发活动,并将它们组织成一棵包含 542 个节点的“研发任务树”。其中 378 个是最底层的具体任务,比如:

  • 评测平台故障诊断
  • RL 沙箱网络策略配置
  • 推理服务事故复盘
  • 数据集版本对齐

接着,另一个 Claude Agent 会调查每类任务的实际执行流程:哪些步骤由人做,哪些已交给 AI。最后,一个独立的 Claude Judge 读取所有证据,为每项任务打上 AL0–AL5 的标签。

Anthropic 承认这套方法存在主观性,尤其是 AL3 和 AL4 的边界。他们呼吁未来若多家公司公布类似数据,应统一标准并引入第三方验证。

算力分配:安全研究占 AI 研发算力的 12%

除了任务自动化程度,Anthropic 还公布了算力使用情况。他们抽样了 2026 年 7 月 13 日至 20 日这一周的数据,将用于 AI 研发的计算资源按用途分类。

结果显示:

  • 整体 AI 研发算力中,约 6% 用于安全研究
  • 在“由 AI 驱动的 AI 研发”部分,安全研究占比升至约 12%

这说明随着自动化程度提高,Anthropic 也在同步增加对安全的投入。毕竟,当数万个 Agent 同时运行时,哪怕极低的错误率也可能累积成风险。

人类的角色正在快速转变

这些数据共同描绘出一个正在成型的“人机混合研发体系”:

  • 人类:提出问题、设定目标、审核结果、做最终决策
  • AI Agent:执行实验、写代码、调试系统、互相委派任务、生成报告
  • 监控系统:实时拦截异常行为,事后审计高风险操作

Anthropic 仍强调,目前没有任务达到 AL5——即 AI 完全自主发现、定义并解决新问题。但趋势已经很明显:从 AL4 占比半年增长 26 倍的速度看,到 2026 年底,这一比例可能接近 80%。

这直接关系到 AI 领域最核心的议题之一:递归自我改进(Recursive Self-Improvement, RSI)。如果 AI 能持续、高效地改进自身研发流程,那么技术进步的节奏可能不再由人类工程师的数量决定,而是由算力、数据和算法效率驱动。

Anthropic 自己就是最谨慎的观察者。作为一家长期担忧 AI 风险的公司,他们一边推进自动化,一边加强监控和安全投入。这种矛盾恰恰说明:RSI 的门槛正在被实际跨越,而不仅仅是理论讨论。

下一次他们更新这个数字时,或许我们会看到一个更接近“自动实验室”的图景——人类依然掌握方向盘,但油门已经交给了 AI。