Anthropic Labs如何用20人小队孵化Claude Code:两周评估、80%想法允许失败

1 阅读

Anthropic Labs:小团队、快节奏、高容忍失败

Anthropic 内部有个叫 Labs 的特殊团队,规模大约只有 20 人。就是这支小队伍,在过去一年多时间里,接连推出了 Claude Code、Model Context Protocol(MCP)和 Claude Design。

文章配图

听起来成果不少,但 Labs 负责人、公司联合创始人 Ben Mann 却直言不讳:他们大多数尝试本来就应该失败。

文章配图

据 Business Insider 报道,Labs 以大约两周为一个周期,对正在开发的产品原型进行一次关键判断:是继续推进,还是调整方向?如果某个想法缺乏前景,团队会果断终止它,或者把其中有价值的部分并入其他项目。只有真正跑通的,才会从 Labs “毕业”,交给公司内部的独立团队接手长期开发和运营。

文章配图

Mann 给出的成功率数字很实在:只有 20% 到 30%。这意味着超过七成的探索不会变成独立产品。但这并不等于浪费——很多未能独立成形的实验,其技术模块、用户洞察或交互逻辑,后来被吸收进了 Claude 的 Chrome 扩展等功能中。

随着 Anthropic 加速商业化,甚至传出正在为上市做准备,这套机制的价值愈发凸显。如何把不断演进的模型能力,快速转化为用户愿意持续使用的产品,成了 Labs 必须持续回答的问题。

像创业孵化器一样运作

Mann 回忆,几年前他还在公司内部推动一个现在看来理所当然的问题:Anthropic 是否应该发布产品?当时公司主要依靠慈善性质的资金支持,重心放在基础研究上。

2024 年,他正式创建了 Labs,目的就是为新产品想法留出一块自由探索的试验田。团队陆续孵化出 Claude Code(代码生成与执行工具)、MCP(让 AI 智能体连接外部数据和工具的协议),以及今年推出的 Claude Design(AI 辅助设计工具)。Instagram 联合创始人 Mike Krieger 等资深产品人也参与其中。

Mann 把 Labs 比作一家真正的“创业孵化器”。这个比喻有明确参照:他曾于 2018 年加入谷歌内部的 Area 120 孵化项目,也熟悉谷歌 X 实验室的运作逻辑——用专门的小团队探索高不确定性方向,等项目成熟后再逐步独立。

但 Labs 有个独特优势:它离 Anthropic 自己的模型研究非常近。前沿模型的能力几乎每个月都在变化。今天某个产品想法可能因为模型不够强而显得鸡肋,但下一轮模型升级后,就可能突然跨过实用门槛。如果产品团队能提前知道哪些能力正在改善,就能更早判断什么值得投入、什么可以开始试。

Claude Code 的诞生,正是这种紧密协作的直接结果。

Claude Code 是怎么来的

据 Mann 介绍,在 2024 年底正式启动 Claude Code 开发之前,研究团队就向 Labs 透露了一个信号:新模型在智能体编程方面展现出明显潜力。这意味着模型不仅能理解代码,还能主动操作、执行甚至调试。

这个信息成了关键触发点。Mann 把这个方向交给了刚加入公司的 Boris Cherny。Cherny 最初提出的方案是一个代码分析工具,但 Mann 觉得格局太小。他在采访中提到,新员工尤其需要“大幅提高自己的目标”,因为智能体究竟能做到什么,仍有很多未知。

这句话点出了 AI 产品开发中的一个现实困境:如果总是基于当前已知的能力设计产品,很容易低估模型下一步能承担的任务。Cherny 随后调整方向,做出了一个更激进的原型——让模型直接编写、编辑并运行代码。

这个版本在内部测试中反响很好。2025 年 2 月,Anthropic 推出 Claude Code 预览版。后续的模型升级又不断强化其能力,比如支持更复杂的项目结构、更好的错误恢复等。如今,Claude Code 已成为 Anthropic 用户增长的重要推动力,Cherny 也顺理成章地负责这一产品线。

允许失败,但不让经验流失

回看 Claude Code 的路径,Labs 的优势并非来自单次灵光一现,而是一套连贯的反馈机制:研究发现能力变化 → 产品团队快速搭建原型 → 内部使用验证需求 → 模型进步反哺体验优化。环节衔接越紧,产品就越有机会踩准技术拐点。

但提前看到机会,并不等于每个想法都值得长期投入。Labs 的核心规则之一,就是定期“断舍离”。

大约每两周,团队会开一次“坚持还是转向”的评估会。这个周期不是要求产品两周内做完,而是检查方向是否依然成立。如果数据或反馈不佳,项目可能被终止,也可能拆解出有用的部分,融入其他探索中。参与者随后转向新任务,保持团队的探索活力。

另一条关键规则是:当项目团队规模通常超过四人时,就必须从 Labs “毕业”

Claude Code 和 Claude Design 都遵循了这条路径。一旦产品验证通过、需要更多工程资源和长期维护,就会移交出去。Labs 由此维持小而灵活的状态,继续探索下一批方向。这也解释了为什么团队人员流动频繁——项目成熟,部分成员随产品离开;Labs 补充新人,开启新一轮尝试。

研究与产品之间的双向通道

让成熟项目及时独立,不仅释放了 Labs 的精力,也避免了小团队被日常运维拖垮。但这种模式也有代价:人员变动频繁,新成员要快速理解最新模型进展,团队协作关系需要不断重建。两周一次的评估能否有效,高度依赖对原型表现的判断质量。

好在,Labs 与研究团队之间并非单向索取。Mann 强调,交流是双向的。产品开发者利用新模型寻找机会,而实际任务中暴露的能力缺口,又会反过来推动研究人员关注新的方向。

他把 Labs 的目标概括为扩大 AI 的“行动空间”——让强大的模型能在现实世界中做更多具体事情。编程需要模型操作代码,设计需要生成合适的视觉结果,跨语言交互则要求系统听懂更多人的表达。产品能否成立,本身就是对模型能力边界的测试。

商业化带来的新张力

随着这些产品进入市场,Anthropic 面临更复杂的商业关系。

Forrester 分析师 Mike Gualtieri 指出,Anthropic 推出的工具可能直接与企业客户现有软件竞争。Claude Design 就是个典型例子——它进入了 Adobe、Figma 等公司主导的设计软件领域。

这里存在一种持续张力:Anthropic 既向开发者和企业提供底层模型能力(作为平台),又基于这些能力构建自己的上层应用(作为产品方)。平台功能越丰富,与其他软件重叠的可能性就越大。

对用户来说,更多内置能力意味着减少工具切换,体验更流畅。但对生态伙伴而言,就得重新思考自己产品的差异化价值。Anthropic 如何平衡这两端,将直接影响其平台的长期吸引力。

如果公司未来完成上市,Labs 还要在更明确的经营目标下,为高不确定性探索保留空间。虽然无法预判上市后研发投入会如何调整,但至少在 Mann 的设想中,Labs 的边界远不止办公和开发工具。

他希望团队未来能参与生物研究、清洁能源存储等现实领域的突破。他认为,加速基础科学研究,才能让 AI 为更多人带来实际收益。

这些仍是愿景,距离可验证的成果还有很长的路。但它们延续了 Labs 已经验证的工作方式:观察能力边界,寻找值得解决的问题,再通过原型检验想法。

Claude Code 证明了其中一条路径可以走通。Labs 接下来的考验,是在不断变化的模型能力与真实用户需求之间,持续找到那个值得投入的“下一项任务”。

对这支约 20 人的团队来说,关键或许从来不是让每个项目成功。能否及时停止前景有限的尝试,让有潜力的产品获得足够资源,才真正决定了这套孵化机制能走多远。