360 播客聊 GUI Agent:AI 最先接管的,可能是你最烦的办公杂活
GUI Agent 到底在解决什么问题
过去半年,我越来越依赖 AI 写代码。Cursor、Claude Code 这些工具帮我补全、重构、写测试,效率提升明显。但只要任务一离开编辑器,我就被打回原形。

月底填工时、走报销,要在公司 OA 里点十几下;提需求得进那个十年没换过皮肤的内网工单系统;偶尔还要把数据从一个后台导出、清洗,再一条条录进另一个系统。这些活都不难,但极其重复、琐碎,而且大多数系统根本没有对外接口。

我也试过 RPA 工具,比如影刀、按钮精灵。脚本能录,但太脆弱——页面一改版、弹窗位置一挪,整条流程就崩。维护成本比自己干还高。让大模型帮忙?它们只会告诉你“第一步点哪、第二步点哪”,自己并不会动手。

360 最近一期播客《这也叫 AI》正好聊到了这个问题。他们提出的方案是 GUI Agent——一种能让 AI 像人一样操作图形界面的智能体。它不依赖系统为你开放 API,而是直接“看”屏幕、“认”界面、“点”按钮、“填”内容。主持人陈军和两位嘉宾(360 人工智能研究院负责人冷大炜博士、AI 博主冷科长)的对话很实在,没有空谈概念,而是聚焦在“怎么让 AI 真的替你干活”这件事上。
两个让人印象深刻的演示
播客里有两个场景让我印象深刻。
第一个是他们在公司内部 ERP 系统上,让 GUI Agent 自动跑通一个 IT 资产申请流程,整整二十七步。听到“二十七步”这个数字,我立刻共情了——我自己走类似流程,点到七八步就开始烦躁。如果 AI 能稳定完成这种长流程,那真是能救命。
第二个更有意思:一次测试中,Agent 一口气自动提交了六百多个资产申请,把审批后台堆满;然后又能一键全部驳回。这个画面有点滑稽,但它说明了一个关键点:当 Agent 能稳定执行,带来的不是某一步省事,而是整条流程的自动化。这意味着,高频、重复的行政事务,未来可能真的不需要人手动干预。
B 端落地的关键:不是技术,是“懂业务”
GUI Agent 的真正难点,其实不在“会不会点按钮”,而在“懂不懂业务”。
通用大模型知道“报销”是什么,但它不可能天生就懂你公司内部的制度:费用类型怎么分、审批链路怎么走、哪些字段必填、哪些情况要走例外流程。同样叫“资产申请”,不同部门的流程可能完全不同。这些细节光靠常识答不出来。
这就是它在企业端最常见的“水土不服”。再加上企业数据有天然壁垒——很多信息不能上网,执行也希望留在本地——你没法直接把敏感数据喂给云端大模型。
360 的解法很务实:不重新训练模型,而是给 AI 找个“老员工”带路。他们称之为“样例知识注入”。
具体做法是:先让人把一个标准流程完整演示一遍(比如怎么报销、怎么申请资产),系统把这个操作过程记录成一个“样例”,存进本地知识库。下次 Agent 遇到类似任务时,通过上下文工程,自动召回最相关的样例,照着“老员工的示范”来操作。
他们放了一个 demo:任务是在企业邮箱里发一封邮件。
- 第一次,没给任何示范,Agent 自己摸索,六分多钟反复失败,因为它不知道内部邮箱的字段逻辑。
- 第二次,先让人手动演示一遍(约两分钟),系统记下样例。再让 Agent 干同样的活,一分多钟就成功发出去了。
同一个任务,效果天差地别,中间只差一个“有人演示过”。
这套思路对熟悉提示工程的人来说并不陌生——本质上就是单样本提示(one-shot prompting)或检索增强(RAG)的延伸。你不用指望模型凭空理解你的业务,而是把“一个好例子 + 完整上下文”在执行时喂给它。360 把这个方法做成了一个能录、能存、能自动召回的闭环,专门用于“填表点按钮”这类具体场景。好处很明显:不用烧钱训模型,数据能留在本地,业务一变,重新录个样例就行。
App 会被“吞掉”吗?
播客标题提到“大模型吞掉 App”,听起来有点吓人,但讨论得很冷静。
我的看法是:分情况。
工具型 App 的入口价值确实可能被削弱。以后点外卖、打车、订票、查物流,你只需要告诉 Agent 目标,它在底层自动完成所有步骤,你未必还需要一个个打开 App。这类以“完成任务”为核心的交互,前台界面有可能被绕过。
但内容和娱乐类 App 就没那么容易被替代。刷短视频、看直播、打游戏、在社区互动,这些行为本身就包含体验、情绪和社交。Agent 可以帮你操作,但无法替你“感受”。
所以更可能的情况是:App 不会消失,但流量入口和功能分发方式会被重塑。用户不再关心底层是 GUI Agent 还是 Coding Agent,他只关心一件事——“我说完,事儿有没有办成”。
冷大炜给 GUI Agent 的定位我很认同:它是数字世界里的“保底执行者”。有接口时配合接口,没接口时就像个软件机器人,靠屏幕和键鼠把最后一公里走完。不性感,但重要。
什么时候能用上?
作为听众,最关心的当然是“啥时候能上手”。播客最后透露了一些产品信息:
- 形态:做成浏览器插件,直接在你自己的浏览器里运行。这个选择很聪明,因为大量企业系统本来就基于 Web。
- 隐私:只在当前工作窗口录屏和操作,不会全局读取屏幕,也不是持续监控,只有执行任务时才读取。这对企业用户来说更容易接受。
- 节奏:先 B 后 C。先在 360 集团内部打磨,再逐步开放外部体验。
- 模型:支持自定义后端模型,你可以用自己的 API,也内置了一些免费选项。
- 时间表:计划六月底在 360 内部开放,预计七、八月份在官网 research.360.cn 对外开放。
第一批适合的人群,是行政、财务、销售等岗位——每天有大量内网登记、填表工作的打工人。对他们来说,能少点几下鼠标,就是实实在在的减负。
“浏览器插件 + 自用 API + 局部录屏”这套组合,基本是冲着像我这样既想用、又担心数据安全的人来的。等七八月官网开放,我大概率会去申请试试。
再泼点冷水:别期待太高
当然,GUI Agent 现在还远没到能完全撒手的程度。播客里也没回避问题:B 端落地最大的挑战是“慢”和“不准”,复杂任务仍需人工兜底。短期内,它更适合做高频、重复、固定的辅助助手,而不是全自动数字员工。
播客里有两句建议值得记住:
- 选对场景:低频任务,直接问大模型就行;只有高频、重复、流程固定的任务,才值得专门上 Agent。
- 用好大模型的核心:上下文给全、指令说清、反馈和监督跟上。冷大炜特别强调:“第一次把背景说清楚最重要,来回聊很多轮,模型反而会越聊越差。”
这跟我日常用 Cursor、Claude Code 的体验完全一致——与其纠缠十几轮,不如第一条 prompt 就把背景、目标、限制一次性讲明白。
写在最后
这期播客让我对 GUI Agent 产生好感,恰恰是因为它的“不装”。它没吹嘘自己万能,反而坦诚承认:不性感、还慢、还在路上。但同时,它把“为什么走视觉这条路”“难在哪”“怎么解”“什么时候能用”讲得清清楚楚。
对我这种在代码里已经享受 AI 红利、但在办公杂务中还在搬砖的人来说,GUI Agent 差不多就是最盼的那块拼图——让 AI 真的长出手脚,去干那些没有接口、又躲不掉的琐事。能少点几下鼠标,对打工人来说,就是实实在在的好处。