DeepSeek Harness实测:Agent界的Android如何重塑AI开发范式?

3 阅读

从聊天到做事:Agent 的壳与核

过去两年,大模型公司卖的是 token,按字数收费,像卖水。但从 Claude Code 开始,行业逐渐意识到,真正值钱的是“把事做完”这个动作本身。模型是大脑,负责思考和规划;而 Harness 是手脚,负责执行和落地。聊天机器人交付的是一段话,Agent 交付的是一件做完的事。这个转变看似简单,却意味着整个技术栈的重心正在从模型层向执行层迁移。

DeepSeek Harness 的发布,正是这一趋势的最新注脚。它不是一个云端服务,而是一个本地运行的开源框架:在装有 Node.js 的电脑上敲一行 npx @deepseek-ai/dsh web,浏览器打开本地 3080 端口,就能看到它的全部界面。会话、日志、数据都留在本地,浏览器只是它的壳。这种设计本身就传递了一个信号:DeepSeek 不想做一个封闭的成品,而是想提供一个开放的底座,让开发者自己组装。

图片

实测:两件小任务,验证大框架

发布当晚,我们把它装进电脑,让它干了两件活:照着 The Verge 的风格重构极客公园官网,再调 GitHub 接口画出它自己的涨星曲线。两件活都交付了,全程 token 花费不到 3 块钱。

图片

第一个任务考验的是它是否真的会“看”网站。我把极客公园官网的网址丢给它,让它参考 The Verge 的风格重新设计。结果生成的页面在布局和配色上确实有 The Verge 的影子,但交互细节仍有瑕疵。不过,通过安装官方插件库中的 DSH-OpenPencil,可以实时预览交互设计文件,让原本单调的 Web UI 变身设计交付工具。这说明,Harness 的能力边界不是固定的,而是可以通过插件不断扩展。

图片

第二个任务考验的是数据提取和可视化能力。我让它用 GitHub 公开 API 查询仓库的 star 数据,结合人工记录的时间点,画一张增长曲线图。它成功调用了 API,生成了图表,并标注了关键节点。整个过程在“轨迹”页中全程留痕:系统提示词、思维链、每一次工具调用和返回结果都记录在案。这种“全程留痕”是它与聊天机器人的根本区别之一——聊天工具只保存最终对话,它保存的是过程里的每一步。

一切皆插件:激进的设计哲学

DeepSeek Harness 最激进的设计是“一切皆插件”。模型、工具、界面、审批策略,甚至驱动整个 Agent 运转的主循环本身,全都可以拆下来换掉。如果你愿意,连前端都可以换成自己喜欢的风格——上手第一时间,我就用 Prompt 将它改成了洋红色主题。

图片

这种设计并非噱头。内测阶段的开发者几天里做了约三百个插件,有人给它换上 Windows XP 的复古皮肤,有人做了表情包插件,让它干完活还能发一张大肥鱼表情包。这种广泛的玩法恰恰说明:这个框架里没有什么是焊死的。

图片

但 star 涨得有多快,冷水来得就有多快。发布第二天,开发者社区的评价开始分化:用户体验对非编程用户不友好,插件生态也引发争议。这些冷水没有一盆是冲着模型来的,全部泼在 Harness 这个“壳”上。壳的成色到底如何,我们的测试正好可以对着看。

图片

成本与争议:算一笔明白账

Harness 本身免费开源,但模型调用照常收费。我们测试时用的是涨价前的价格,因此仍然量大管饱——整篇文章的 Demo 测试下来,token 消耗没超过 3 块钱。此外,DeepSeek Harness 还会主动帮你把账算得明明白白:每个会话底部都挂着实时统计,这一轮几步、模型耗时几秒、输入输出各多少 token、甚至缓存命中率多少,都会摊开给你看。

图片

争议也恰好出在这里。发布次日,一项第三方对比称,同款 V4-Flash 接入另一个开源 harness Pi,token 消耗只有 DeepSeek Harness 的三成多。我们自己的使用体感上,除了使用 V4 Pro Max 仍然量大管饱之外,直接使用 V4 Flash 不仅速度更快,内容生成准确率也没有降低很多。或许这也代表着目前 Harness 确实还处在开发者预览版阶段,并非最终版本。

图片

模型与 Harness:能力上限与兑现程度

图片

模型公司亲自下场做“壳”,DeepSeek 不是第一家。Anthropic 有 Claude Code,OpenAI 有 Codex,现在名单上补齐了最后一个大玩家。Harness 可能是大模型打通生产场景目前最重要的路径之一。开发者工具公司 Composio 做过一个对照测试:同一个 V4-Flash,接入八种不同的 harness,完成三十项任务。最好的完成了二十项,最差的只有十四项。模型一模一样,结果差出三成。

图片

这组数据揭示了一个关键事实:模型划定能力上限,Harness 决定这份能力最终能兑现多少。对 DeepSeek 来说,这层壳还有三重更现实的账。成本上,上下文怎么组织、缓存怎么命中,决定一个任务烧多少 token、重试几次,这些都发生在 Harness 层,别人的壳它管不着。数据上,任务失败的完整记录是改进模型最好的养料,而记录握在壳的手里。生态上,团队表示会向部分开发者提供 API 额度——把插件开发者留在自己院子里的意图,不算隐晦。

开源的意义:赌一个生态

DeepSeek 是第一个把整个壳都开源的大玩家。它赌的是另一条路:别人把 Agent 做成成品卖给你,它把 Agent 的零件全部摊开,赌开发者会用这些零件,拼出它自己都没想到的东西。

回头看,“像框架、不像成品”这句今天关于 DeepSeek Harness 最大的争议,放在另一个坐标系里就是恭维——安卓刚问世的时候,也是一副毛坯的样子,粗糙、开放、只吸引动手的人。后来的事,大家都知道了。DeepSeek 赌的,是 Agent 这个行当也需要一个安卓。

开发者视角:机会与挑战

对于开发者而言,DeepSeek Harness 提供了一个前所未有的实验场。你可以自由替换模型,从 V4-Flash 到 V4 Pro Max,甚至接入其他厂商的模型;你可以自定义工具,从网页抓取到 API 调用;你甚至可以重写主循环,改变 Agent 的决策逻辑。这种灵活性意味着,Harness 不再是一个固定的产品,而是一个可以不断演化的平台。

DeepSeek Harness 产品界面截图,展示了“探索

但挑战同样明显。首先,学习曲线陡峭,非编程用户几乎无法上手。其次,插件生态尚不成熟,官方插件库只有少量插件,质量参差不齐。最后,token 消耗的优化空间很大,如何设计高效的上下文管理策略,是每个开发者都需要思考的问题。

图片

未来展望:Agent 的 Android 时刻

图片

DeepSeek Harness 的发布,标志着 Agent 开发进入了一个新阶段。它不再是一个黑盒工具,而是一个开放平台。正如 Android 通过开源和插件化,最终统治了移动操作系统市场,DeepSeek Harness 也有可能通过同样的策略,成为 Agent 开发的事实标准。

当然,这条路不会一帆风顺。它需要面对来自 Claude Code、Codex 等成熟产品的竞争,也需要解决自身在用户体验和性能上的短板。但无论如何,DeepSeek Harness 已经迈出了第一步,而这一步,可能比我们想象的要大得多。

对于开发者来说,现在正是探索这个新平台的最佳时机。无论你是想构建一个自动化工作流,还是想开发一个全新的 Agent 应用,DeepSeek Harness 都提供了一个值得投入的起点。未来几个月,随着核心插件和基础接口的快速演化,这个平台的能力边界将不断扩展,而早期参与者的经验,将成为宝贵的财富。