北京发布智能体新政十策:一人公司崛起与Agent经济蓝图解析

1 阅读

从模型竞赛到工程化落地:智能体经济的政策信号

一份仅十条的政策文件在北京落地,却将过去活跃于技术社区黑话中的术语——如Agentic AI、Harness Engineering、AI OS、FDE、OPC、Token经济、TaaS、AaaS、RaaS等——正式写入了行政公文。尤其是“驾驭层工程”被置于核心位置,标志着AI产业的重心已从单纯追求基础模型的能力上限,全面转向智能体(Agent)的工程化落地与生态构建。这一转变不仅确立了智能体经济的政策轮廓,更预示着一场从技术底层到商业模式的深度重构。

基础能力的新标尺:从Benchmark到任务完成度

政策第一条直指基础模型的核心痛点:持续提升实际任务完成能力。过去几年,行业过度关注Benchmark分数,但智能体在真实场景中面临的是模糊目标、信息缺失和动态环境。这里存在一个残酷的数学逻辑:假设Agent连续执行100步,每步正确率99%,全链路成功的概率骤降至约36.6%;即便单步准确率提升至99.9%,完整跑通概率也仅为90.5%。这意味着,智能体的实用价值是模型能力、长程可靠性、环境可操作性及结果可验证性的乘积。任何一项趋近于零,总价值即归零。

这一逻辑解释了为何代码成为智能体最早爆发的领域:其高度数字化、可回滚、可验证的特性完美契合长程任务需求。前沿评测体系如METR提出的“Task Completion Time Horizon”,直接测试Agent以50%或80%成功率独立完成专家级任务所需时间,这标志着评测标准从“单次生成质量”转向“长程任务执行力”。对于开发者而言,提升单步准确率不再是唯一目标,构建能够自我修正、反馈循环的长程执行系统才是关键。

驾驭层工程:能力兑现的系统性底座

第二条政策提出的“驾驭层工程”(Harness Engineering),强调了模型之外系统性架构的重要性。模型仅提供潜在能力,而能力的稳定兑现取决于上下文工程、任务持久化、多智能体协作及系统可扩展性。HuggingFace今年4月发表的《Agentic Harness Engineering》研究证实,在保持基础模型不变的情况下,仅通过迭代工具、中间件、长期记忆和可观测系统,Terminal-Bench2的Pass@1从69.7%提升至77.0%,跨模型家族仍有5.1至10.1个百分点的提升。这表明,增益主要来源于系统层的优化,而非单纯修改系统提示词。

政策进一步指出,未来软件商店和AIP(Agent Interface Protocol)将成为新标准。软件的价值不仅在于用户排名,更在于其被Agent发现、集成及作为默认Skill调用的能力。这要求开发者从“构建功能”转向“构建接口”,将软件能力模块化、标准化,以便智能体能够无缝接入并调用。

需求智能与FDE:软件架构的重构

第三条政策鼓励基于智能体重构底层架构,核心是“需求智能”的兴起。软件智能分为三层:功能智能仅提供单点生成,流程智能串联固定工作流,而需求智能则允许用户仅描述目标,系统自动拆解步骤、调度模型与Skill、连接软件并对最终结果负责。与之对应的是“超级软件”概念——其核心竞争力不在于功能数量,而在于跨越软件边界、统一理解需求并重组分散能力。

政策特别提及“前沿部署工程师”(FDE)角色,强调深入客户现场,拆解流程、接入系统、清理数据,并将新问题反馈至产品迭代。判断标杆场景的五个关键指标——任务频率、人工成本、数字化程度、结果可验证性、错误可撤销性——决定了真实ROI。科学、医疗、教育、政务、制造及文化领域因符合这些特征,成为首批落地场景。

终端嵌入与OPC模式:创业边界的消解

第四条政策推动智能体深度嵌入手机、眼镜、可穿戴设备及汽车,构建“芯模云端用五位一体”生态。终端Agent需具备持续环境感知、用户状态理解及长期上下文记忆能力,实现低延迟感知与复杂推理的协同。这一布局直接响应了需求侧,符合条件的新产品可纳入家电以旧换新及数码购新补贴范围。

第五条政策最具颠覆性:支持以“一人公司”(OPC)为代表的创新创业模式。科斯理论曾解释公司存在的合理性在于降低内部协调成本,而智能体同时压低了执行与协调成本。过去需多岗位协作的知识工作——如代码编写、设计、客户咨询、报表处理——现可由一个人通过多套Agent串联完成。政策通过弹性算力、专业孵化、科技金融、全周期服务站等措施,将原本企业内部后台能力转化为社会公共服务。对创业者而言,核心竞争力已转变为行业判断力、客户信任关系及可复用的Agent系统架构。

Token经济向价值计费转型:商业模式的跃迁

第六条政策直面Token经济的困境:动态任务的不确定性导致Token消耗与价值产出严重脱节。政策明确鼓励从“Token消耗量计费”转向“价值计费”,并建立由智能质量、调用量、转化效率组成的评价体系。这标志着三种商业模式的层级分化:

  • TaaS(Token as a Service):售卖基础Token与推理供给,竞争焦点在于价格、速度、稳定性及模型质量。
  • AaaS(Agent as a Service):封装模型、工具及Harness,售卖特定能力,竞争焦点在于任务完成效率。
  • RaaS(Result as a Service):直接售卖结果,客户仅关心最终交付(如合同审完、代码修复、线索转化),竞争焦点在于责任承担与结果确定性。

越往上层,离Token越远,离客户价值越近,但供应商需承担任务失败、重复执行及质量验收风险。智能体公司需重新核算“每个成功任务成本”(Cost per Successful Task)及“每个成功任务价值”(Value per Successful Task)。政策提出探索Token券与智能体服务券,以Token工厂解决供给,服务券启动需求,形成商业闭环。

安全治理与基础设施:智能体时代的护城河

第七条政策强调智能体安全从内容审核转向运行时治理。智能体拥有行动权,风险从“话语错误”扩大为“行动错误”,涉及目标理解偏差、权限越界、提示词注入、长期记忆污染及多智能体错误放大。政策建议实施分级分类监管,低风险任务快速自测,高风险任务严格人工确认,将安全转化为市场准入证。

第八条“银河算廊”工程旨在建设面向智能体高频并发、低延迟需求的新型算力基础设施。智能体推理不同于大模型训练的集中式工程,它更像一张全天候响应的生产网络,负载随真实业务剧烈波动。银河算廊需实现算力路由、异构调度及边缘推理,并支持金融机构开发针对智能体资产(如代码、数据、合同及“任务轨迹”)的金融服务。任务轨迹——包括目标、计划、动作、观察、纠错及结果——将成为训练模型、优化Harness及分析业务流程的核心资产。

第九条政策推动开源开放与国际合作,强调协议标准在智能体生态中的核心地位。智能体天生需要连接,生态网络效应极强:新Skill接入后,兼容协议的Agent均可获得能力;Agent越多,开发者越愿供Skill;Skill越多,Agent越有价值。政策提出“一国一策”出海路径,因智能体更深嵌入当地经济,需应对复杂的隐私、责任与准入问题。

结语:能力重估与机遇分布

第十条政策统筹各类资金支持,覆盖技术攻关、平台搭建及示范应用。智能体时代对每个人和每家公司都是一次直接的能力重估。大多数职业不会一夜消失,而是被拆解为几十个任务,其中重复、流程化、易验证的部分率先被Agent接管。只会完成中间步骤、无法判断结果或无法对最终交付负责的人,将面临巨大压力。然而,机遇也藏在任务重新分配中:过去需资金、团队和管理才能构成的公司,现在带着一套成熟Agent系统,也可从小型真实任务开始放大自身价值。智能体不会自动带来成功,但它将个体的目标、判断、专业和执行系统成倍放大,为“一人公司”和高效能个体提供了前所未有的杠杆。