AI Coding 与具身智能双线突破:代码生成逼近极致性能,人形机器人进入量产验证期
AI Coding:从写得出到跑得快
过去几个月,AI 编程工具不再满足于“能生成代码”,而是开始挑战人类专家和编译器的性能极限。字节跳动 Seed 团队与清华大学智能产业研究院(AIR)联合推出的 CUDA Agent 是一个标志性案例。这个基于强化学习的大模型专门生成 GPU 内核代码,在 KernelBench 的 250 个任务中,成功率高达 98.8%。更关键的是,其中 96.8% 的生成内核比 PyTorch 的 torch.compile 更快。

系统采用 PPO 算法训练,运行在安全沙箱中,避免生成危险代码。团队同时开源了包含 6000 个样本的 CUDA-Agent-Ops-6K 数据集和训练配方。这意味着,AI 不仅能写底层代码,还能写出比主流编译器优化后更高效的版本——这对自动驾驶、大模型推理等对延迟极度敏感的场景意义重大。

与此同时,开发者的日常工具链也在被重构。被 SpaceX 收购的 Cursor 推出了 Origin,一个专为 AI Agent 高频提交设计的 Git 兼容代码托管平台。它支持仓库管理、PR 流程,并能与 GitHub 双向同步。上线当天恰逢 GitHub 全球宕机 8 小时,意外形成“神助攻”。Origin 的目标很明确:当 AI Agent 每月生成超过 1700 万个 PR 时,传统代码托管平台的架构已显吃力。Origin 试图成为“Agent 原生”的新一代基础设施。
轻量化路线也在加速。Vercel Labs 开源的 fx 仅 6.4MB,用 Zig 编写,冷启动只需 10 微秒。它支持本地模型、API 或网关调用,还能通过 WebAssembly 嵌入到任意环境。Hacker News 上获得 143 分热议。fx 的理念是做“Unix 工具”,而非假装成应用的终端。这种极简设计代表了编码 Agent 的另一条路径:不是取代 IDE,而是作为可嵌入流水线的基础设施原语。
大模型能力分化:代码、安全与合规
国产大模型在代码和安全领域的进步同样显著。智谱发布的 GLM-5.3 在代码生成和网络安全任务上取得重大突破,部分安全能力甚至追平或超过海外闭源模型。公司同步启动“开源的盾”计划,为重点开源项目提供免费安全审计和模型额度。这标志着中国开源大模型正从“会写代码”转向“守护数字基础设施”。
DeepSeek 的 V4 Pro 正式版(总参数 1.6 万亿,激活约 490 亿)全系开源,支持百万 Token 上下文。多项指标已接近 Anthropic Fable 5 等顶尖闭源模型。其 Flash 版采用分时定价,空闲时段低至 4.5 元/百万 Token。价格优势加上接近闭源的性能,让开源模型从“开放源代码”真正走向“开放资源”。同期,阿里 Qwen3.8-Max 进入 LMArena 综合榜 Top5,两浙产模型连续多周包揽全球开源调用量前两位。
Claude 生态则在功能扩展与合规之间寻找平衡。其 Code 产品将整合 /design 命令,允许开发者在终端创建 UI 设计模型并生成可共享原型。更进一步,Claude 现在可以自主发送 Gmail——开启设置后,能直接发信、回复或转发,无需人工确认。但为遵守欧盟 AI 法案,所有 Claude 输出都添加了不可感知的统计水印。讽刺的是,GitHub 上很快出现了针对 Claude 的去水印工具。水印与反水印的博弈,已成为 AI 合规的新常态。
办公场景实测:国产 Agent 表现亮眼
AI Agent 在真实办公环境中的表现如何?华尔街投行杰富瑞做了一次实测。他们测试了中美八款主流 Agent,覆盖多文件检索、联网研究、浏览器操作、PPT 制作和多模态生成五大场景。结果,阿里千问办公以 95 分排名第一,略胜 Claude Cowork(94 分)和 OpenAI Codex(92 分)。Kimi Work、豆包、MiniMax Code 等国产产品也全部入榜。
这一结果说明,在复杂、多步骤的真实办公任务中,国产 Agent 已具备与国际顶尖产品正面竞争的能力。背后是本地化数据、中文理解优化和场景适配的综合优势。
企业内部的渗透率数据更具说服力。快手 2026 年 Q2 业绩显示,员工使用自研 AI Agent 产品的比例超过 92%,而研发人员的 AI 代码贡献率达到 60%。这是一个关键里程碑——意味着大型互联网公司的核心研发流程已被 AI 实质性重构。同期,其可灵 AI 业务收入超 8.5 亿元,同比增长超 200%。
企业微信也在主动打开生态。它升级了 CLI 与 MCP 协议,向 DeepSeek Harness、MiniMax Code、WorkBuddy 及自建 Agent 开放文档、表格、邮件、会议、日程、通讯录等十大办公能力。这种无门槛开放,为 Agent 在企业落地提供了标准 API 入口。
具身智能:从表演到打工
如果说 AI Coding 在软件层加速进化,那么具身智能则在硬件层迎来转折点。2026 世界机器人大会(WRC)最明显的信号是:行业叙事从“炫技表演”转向“实景干活”。373 家企业带来 3000 多件展品,其中 300 多件为首发新品,数量比上届增长超 140%。大会首次设立“采购日”,参展采购商从 80 多家增至 200 多家,所有 300 多台真机全部动态运行。
中国厂商在全球人形机器人市场占据绝对主导。据 SAG 报告,2026 上半年全球出货 1.91 万台,同比增长 272%,其中中国企业占比超 97%。智元以 8400 台(44%)登顶,宇树以 5900 台(31%)紧随其后。但需注意,“出货量幻觉”依然存在——超过 65% 的机器人仍用于演示或测试,真正投入持续生产的不足 35%。行业正处于从“好看”到“好用”的过渡窗口。
小米的进展提供了透明参照。其新款人形机器人“铁大”(1.70 米,66 自由度)在小米汽车工厂的自攻螺母上件工站,双侧作业成功率从 90.2% 提升至 98%,距离人工的 99% 仅差 1 个百分点。新增的中控台侧盖板排序与料箱折叠回收工站,成功率也达到 90%。这种“自研自用”模式,让小米拥有天然的训练场和验证闭环。
宇树科技登陆资本市场,上市首日高开 629.44%。其在 WRC 展示的机械臂能细致抚平衣物褶皱、快速归类杂乱货品,家庭和商用场景的实操能力直观可见。资本市场对硬件供应链的认可度很高,但产业链普遍认为,机器人的“大脑”价值尚未被充分定价。
商业化落地:工业与电力成突破口
真正的商业化信号来自订单和认证。无界动力的轮式半人形机器人 K15 获得全球首个工业级全域 CE 认证,成为首个通过欧盟合规准入的具身智能产品。公司已签署总额 7 亿元的全球订单,其中包括与远景科技集团的 5 亿元合作——这是国内具身智能操作领域首个亿元级海外订单。8 月,其海淀中试平台落成,打通了“大脑研发—中试验证—全球交付”的完整链条。
国家层面的动作更具确定性。国家电网内部印发具身智能规划,计划投入 68 亿元,集中采购 8500 台具身智能设备,其中包括 500 台人形带电作业机器人。叠加 WRC 上央企联合体的亮相,标志着“国家队”正式下场,补齐量产能力和场景落地的短板。电力巡检和带电作业,可能成为继工业制造之后的下一个规模化应用场景。
训练基础设施也在快速铺开。中国信通院报告显示,截至 2026 年 6 月底,全国已建成启用超 70 家具身智能训练场,在建或规划中的还有 46 家。这些训练场 60% 以上为综合类,覆盖长三角、京津冀、珠三角三大集群,并向二三线城市延伸。数据采集→训练→验证→落地→升级的全链条服务能力正在成型。
技术前沿与跨界动态
其他值得关注的动态包括:彭博报道称,SpaceX 曾试图收购 AI 编程公司 Cognition(Devin 母公司),虽未成功,但马斯克最终以 600 亿美元收购 Cursor,显示出对 AI Coding 战略价值的高度重视。
在脑机接口领域,Neuralink 完成了全球首例 经硬脑膜植入手术,信号采集精度较此前的硬膜外路线进一步提升。同期,华山医院牵头的国内首款硬膜下植入式 BCI 系统启动三类注册临床。信号精度的跃升,可能解锁更复杂的意念控制场景。
特斯拉中国在车机系统中引入火山引擎的 豆包大模型,为 Model 3/Y/S/X 提供实时信息查询和自然对话能力。尽管马斯克有自研模型,但在座舱体验上选择中国本土供应商,说明国产大模型在特定场景已具备不可替代性。
北京人形机器人创新中心发布的 天工 Omni 和 Pelican-Unify 1.0 具身大模型,则展示了“感知—理解—决策—执行”的全栈能力。天工 Omni 能完成梅花桩、上下楼梯、匍匐爬行等极限动作,而 Pelican-Unify 开放底层接口,支持二次开发,标志具身智能进入“协同进化”新阶段。
星海图在 WRC 展示了两项全球首创:一是机器人在京东真实前置仓自主完成拣选、导航、打包全流程;二是机器人组装机器人,全程无需人工干预。其 G0.5 具身基础模型支持少样本泛化——无需为每个 SKU 单独编程,仅需少量样本即可识别抓取。这种能力正从论文走向产线。
LG 与 Nvidia 则瞄准了另一个瓶颈:训练数据。双方设定目标,积累 10 万小时人形机器人训练数据,相当于 11 年连续运行。数据来源结合物理测试与 Nvidia Omniverse 仿真平台生成的合成数据。高管级会晤表明,这是一场长期投入的“军备竞赛”。
GitHub 的开源趋势也印证了方向转变。8 月 19 日趋势榜前三名分别是 OpenViking(自演进上下文数据库)、codex-security(安全工具)和 Kimi-K3(Agent 框架)。Agent 的记忆、编排、安全三类仓库霸榜,说明社区关注点已从“训练更大模型”转向“构建 Agent 基础设施”。