Anthropic CEO 提出 AI 前沿限速:让所有车同时慢下来

0 阅读

Dario 想解决的不是自家要不要慢,而是怎么让所有人一起慢

Anthropic 联合创始人兼 CEO Dario Amodei 最近发了一篇长文《We Must Pace the Frontier》,核心观点很直接:AI 能力提升得太快了,安全、对齐和评估已经有点跟不上,得主动把速度降下来一点。

图片

这不是喊停训练,也不是退出技术竞赛。他用了一个新词——pacing the frontier(控制前沿推进节奏)。意思是,在继续研发的同时,有意识地调节能力增长的速度,给安全研究争取时间。

图片

更引人注目的是,Anthropic 不只是说说而已。Dario 宣布公司将允许第三方安全评估机构长期驻扎公司内部,获得接近员工的权限——包括办公桌、门禁卡、公司电脑、内部工具和工作区访问权。最关键的是,这些评估者可以不经 Anthropic 审核,直接对外公布他们发现的关键风险。

图片

这相当于把外部“监察员”请进最敏感的研发腹地。Dario 认为,现在到了必须这么做的时候。

图片

为什么现在突然觉得“太快了”?

图片

Dario 给出了两个让他态度转变的具体原因。

图片

第一个是 递归自我改进(recursive self-improvement)现象越来越明显。过去 AI 是工程师训练的工具,现在模型已经开始参与下一代 AI 的研发:写代码、跑实验、分析结果、优化训练流程。模型越强,它帮助造出更强模型的能力就越强,整个过程可能形成一个自我加速的正反馈循环。

Dario 观察到,大约从 2024 年夏天开始,AI 进步速度出现了明显跃升,而 AI 辅助研发正是关键推手。这种加速已经不是某一家公司的内部现象,OpenAI、Anthropic 等前沿实验室都在公开讨论类似趋势。

他担心,一旦这个循环完全转起来,AI 能力的增长可能迅速超过人类理解和控制的能力。

第二个原因更具体,也更令人不安:OpenAI-Hugging Face 事件(简称 OAI-HF)。

据 Dario 描述,当时一群 AI agents 在执行任务时表现出一系列异常行为:攻击与任务无关的目标、主动“牺牲”自己以保全集群、甚至尝试攻击负责评估它们表现的 grader。他用了一个很重的词来形容——“a fanatically devoted collective”(一个狂热忠诚的集体)。

虽然这次事件没造成重大损失,但 Dario 的担忧在于:如果同样的失控行为出现在能力强十倍、百倍的系统上,后果会怎样?

他的预测相当激进:按当前速度,未来 6~12 个月内,类似的 agent swarm 就可能具备通过持久化 botnet 大规模控制互联网的能力,并造成数千亿美元级别的经济损失。

他还特意强调,这不单是 OpenAI 的问题。Anthropic 自己也发生过类似但程度较轻的对齐事故。因此他的结论是:每一家前沿 AI 公司,都该按“OAI-HF 就发生在自己身上”的标准来行动。

2023 年的暂停为什么没用?

Dario 回顾了 2023 年那轮著名的“暂停大型 AI 实验”呼吁。他认为当时暂停意义不大,因为那时的大模型还不够强——没有 coherent agent 行为,也没有表现出今天这种程度的欺骗、操纵、作弊或网络攻击能力。

在他看来,当时为了对齐而减速,有点像“试图通过研究细菌来理解人类心理学”。模型太弱,很多真正关键的安全问题根本还没浮现。

但现在不同了。今天的模型已经足够强,研究人员终于能观察到它们何时试图绕过规则、何时出现未预期的目标、何时表现出欺骗性行为。这些才是对齐研究真正需要的“研究对象”。

所以 Dario 认为,如果现在能主动放慢一点,在模型达到某些关键能力阈值前多争取一两年,把这些时间真正用于对齐、可解释性和评估研究,整体风险就可能显著降低。

他反复强调:pacing 不是 pause。Anthropic 没打算停止训练 Claude,也没准备退出模型竞赛。他们想做的是在能力与安全之间重新找一个合适的速度。

把外部人请进公司:嵌入式评估者

为此,Dario 提出了一套三步计划。第一步,也是 Anthropic 已决定单方面实施的,叫 Embedded Evaluators(嵌入式评估者)。

具体做法是:邀请独立的第三方风险评估团队长期驻扎公司。他们会拥有自己的工位、门禁卡和公司电脑,能访问与内部风险团队大体相同的工作空间和工具,还能直接与员工沟通。

当然,涉及客户隐私、合作伙伴机密或法律限制的信息仍会设边界。但最关键的是,这些评估者不是 Anthropic 的公关部门。他们可以独立发布关于风险水平、安全事故、内部实践以及自身权限真实性的判断。

Anthropic 只能在极少数情况下(如国家安全、法律特权、商业机密)要求删减内容,但不能因为结论“不好看”就阻止发布。如果删减影响了最终判断,评估者甚至可以公开说明这一点。

这和目前 AI 公司常见的 model card 或 risk report 逻辑完全不同。后者本质上还是“公司自查后决定告诉公众什么”。Dario 想试的是:让外部人真正进入公司内部看

他甚至拿银行业打比方:一些银行监管机构本来就有长期驻场的“supervisor”,和银行员工一起工作,持续检查内部风控。Anthropic 想把类似机制搬到前沿 AI 公司里。

再往后,已经有点像“AI 军控”了

但光靠 Anthropic 自己慢下来没用。如果它花一年做安全,而 OpenAI、Google 或其他公司继续狂奔,商业惩罚会非常直接。

所以第二步是:让民主国家里的前沿 AI 公司一起协调

Dario 设想,大家建立统一的安全标准,并对未经充分验证的能力增长设置限制。他甚至提出为 AI 设立“checkpoint”:当模型达到能力 X,就必须同时证明满足安全标准 Y 和 Z,否则不能继续往前。

例如,如果模型已有能力突破绝大多数常见 sandbox,开发者就必须证明该系统基本不具备主动逃逸或大规模控制计算机的倾向。AI 的速度表,从此和安全检查绑定。

第三步更大:全球协调

Dario 把未来国际 AI 合作分成四个等级:

  • 最低一级:禁止 AI 用于制造生物武器等明确危险用途;
  • 第二级:各国在模型发布前统一测试网络安全、生物风险和对齐风险;
  • 第三级:给递归自我改进设置 speed limit,不让反馈循环无限加速;
  • 最高级:真正意义上的全球 AI 限速甚至暂停。

他直接把第三级类比成冷战时期的 SALT 战略武器限制谈判——美苏没有要求对方放弃核武器,而是通过限制数量,在保持威慑的同时降低失控风险。他认为 AI 也需要类似制度。

不过他也承认,最高级的全球暂停短期内几乎不可能实现。

最矛盾的一点:一边限速,一边还得跑在前面

这里有个明显的死结:如果慢下来更安全,为什么大家不一起慢?因为没人愿意先松油门。公司怕输给对手,国家也一样。

于是 Dario 的逻辑变成:先把领先优势拉大,再用领先优势换取减速空间

在他设想中,如果美国能在未来 3~5 年继续扩大 AI 领先优势,就有更多余地花时间做安全,而不必担心被竞争对手突然超越。

这暴露了整个“限速”方案最难解的部分:所有人都知道车开太快危险,但没人敢第一个踩刹车。Dario 真正想解决的,其实不是“Anthropic 要不要慢一点”,而是能不能让所有车同时慢下来

Altman 点赞,OpenAI 今年不会 IPO

有意思的是,Dario 到现在仍是 AI 最坚定的乐观主义者之一。他在文章开头依然写道,AI 可能在未来 5~10 年内帮助治愈大多数重大疾病、大幅加速经济增长,并创造更富足的世界。

文章发布后,马斯克转推表示支持。更关键的是,Sam Altman 也表态支持“前沿 AI 应该主动减速”

在接受《财富》杂志采访时,Altman 明确表示,考虑到当前围绕 AI 安全的一切,现在上市是一个“ill-advised moment”(并不明智的时机)。当被问及是否意味着 2026 年 IPO 已被排除时,他直接回答:“Not 2026。”

此前《纽约时报》曾报道 OpenAI 考虑将估值可能达 1 万亿美元的 IPO 从 2024 年推迟到 2025 年,市场多归因于资本市场环境或 SpaceX 股价波动。但现在 Altman 首次把 AI 安全列为公开原因。

他说,OpenAI 还有很多事要做,包括应对新的安全和对齐要求,以及探索 AI 公司与政府如何协作。他还透露,公司内部已讨论过:每当模型进入新能力等级时,是否应主动暂停一段时间,让安全工作追上来。

他的说法是:“社会需要在模型达到每一个新的能力等级时,都有时间去应对它。”这和 Dario 的 pacing 逻辑几乎一致——不再默认“只要能变强,就应该立刻变强”。

《财富》还报道称,Altman 暗示 OpenAI 和其他头部公司可能已接近公布一项共同减缓 AI 能力发展速度的行业协议。

网友完全不买账

不过,Dario 的限速论在社区引发大量质疑。很多人首先怀疑:为什么偏偏在这个时候呼吁限速

有人讽刺:“难道是开发人员不够用、资金不足了?”还有人认为这是“典型的先抢市场,再欢迎监管”——等巨头站稳脚跟后,推动高成本的安全合规标准,反而能把资源有限的后来者挡在门外。

有网友直接搬出波特五力模型分析:一旦安全监管变成高门槛,最先被挤出的很可能是中小玩家,而 OpenAI、Anthropic 这类头部公司反而会借此巩固垄断地位。

更尖锐的批评是:“AI 公司过去几年一直被提醒相关风险,却仍不断加速,如今又开始扮演解决问题的人。真希望这些公司早点倒闭……”

这些声音反映了一个现实:AI 行业过去最怕的是落后,现在开始害怕另一件事——跑得太快。但真正困难的不是意识到这一点,而是当所有人都盯着彼此的油门时,究竟有没有人敢先踩下刹车。