数据时效:2026-08 2026 年 8 月 13 日,DeepSeek 开源了 DeepSeek Harness 的开发者预览版。

官方给它的定义很克制。这是一套面向 Harness 开发者开放测试的 Agent Harness,许可证是 MIT,命令行名称是 dsh。我查过产品页、仓库和开发文档,没有看到“DeepSeek 首款 Agent 产品”这句话。这个头衔可以先放下。

更有意思的事实藏在架构里。DeepSeek 把模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 都做成插件。开发者可以换掉其中任一部分,再把它们重新组起来。Agent 不再是一只封好的盒子,里面的接缝都露了出来。

我的判断也放在这里。Harness 还会存在很久,用户会越来越少看见它。规划、工具选择、上下文整理和局部纠错会逐渐交给模型。权限、沙箱、审计、成本和执行证据仍要由外部系统管理。前一层会变薄,后一层可能更厚。

证明产品真实存在、当前状态和官方自我定位

Agent 这次被拆到了运行时

Harness 可以先理解成模型外面的运行系统。模型负责生成下一步行动,Harness 把工作区、工具、权限、记忆和执行结果送进来,再把模型的决定变成真实动作。Codex、Claude Code 和许多编码 Agent 内部都有这样的系统,只是普通用户很少需要看见。

DeepSeek Harness 把这套系统摆到了产品正面。它下面的 Cordis 内核只管插件加载、卸载和依赖关系,不直接提供 Agent 能力。文件编辑是插件,模型适配是插件,沙箱和存储也是插件。UI 都可以替换。开发者不用改核心源码,可以在配置层重新组合这些能力。

官方还给了四种预设。标准模式是一套完整编码 Agent,带文件编辑、Shell、检索、Skills、计划、子 Agent 和工作流。PTC 模式让模型生成一段 TypeScript 程序,一次组合多步工具调用。极简模式只留下持久 bash 和编辑器,用于控制变量做基准测试。创造模式可以检查当前运行时,在内存里试验 Cordis 插件,再生成自定义 Agent preset。

preset 可以翻成预设方案。它保存一整套 Agent 运行方式,比一句提示词管得更多。模型选谁,工具开放哪些,循环怎样跑,遇到高风险动作要不要审批,都可以成为预设的一部分。

帮助读者区分一体化产品和运行时级插件化的抽象层级

这给个人开发者带来的变化很具体。以前想做一个研究 Agent,常见做法是先选框架,再写模型适配、工具注册、状态存储和日志,最后补一个能用的界面。DeepSeek Harness 已经给出可运行的底盘,开发者可以把精力放在任务边界和能力组合上。

“可以组装”与“组装起来很好用”仍有一段距离。官方把当前版本标为开发者预览,并用大写字母警告会出现兼容性破坏。这个提醒很实在。插件越多,依赖冲突、接口差异、权限遗漏和失败传播的机会也越多。创造模式能帮人生成预设,生产环境里的兼容测试不会跟着消失。

Codex 和 Claude Code 也已经插件化

把 DeepSeek Harness 写成开放框架,把 Codex、Claude Code 写成封闭产品,文章会立刻过时。

OpenAI 的官方文档显示,Codex 当前可以安装包含 Skills、连接器和 MCP 工具的插件,CLI 里还有插件浏览器。它也支持 Hooks、子 Agent、沙箱和工作树。OpenAI 甚至有一项叫 Record & Replay 的功能,可以在 macOS 上录下操作流程,再把演示变成可复用 Skill。

Claude Code 的扩展文档列得更细。Skills、子 Agent、MCP、Hooks 和插件都已经进入正式体系。权限规则还能配合 PreToolUse Hook,在工具执行前拒绝、询问或放行。

三者的差别落在默认选择由谁承担。

比较项DeepSeek HarnessCodexClaude Code
默认交付开源 Harness 和 Web UI完整 Agent 产品与多端体验完整编码 Agent 与 CLI
运行时替换官方把模型、工具、会话、沙箱、循环和 UI 都列为插件可扩展 Skills、MCP、Hooks 和子 Agent,核心运行时由产品管理可扩展 Skills、MCP、Hooks 和子 Agent,核心运行时由产品管理
回放含义会话事件流可恢复、分叉、检索和回放可把桌面操作录成 Skill,另有会话恢复以会话恢复、转录和 Hooks 为主
计费入口软件 MIT 免费,模型 API 另付套餐额度与 creditsPro、Max 套餐或 API 余额

Codex 和 Claude Code 先替用户选好一套模型、工具、循环和交互,再开放扩展口。DeepSeek Harness 让开发者接手更多选择。它们可以互相吸收,也可以叠在一起。DeepSeek 的官方文档就提供了把自家模型接入 Claude Code 的方法。

这也解释了价格为什么难以排成一张胜负表。Harness 本身免费,不代表 Agent 免费。截至 2026 年 8 月 15 日,DeepSeek V4 Flash 的缓存未命中输入和输出价格分别是每百万 token 0.14 美元和 0.28 美元,V4 Pro 分别是 0.435 美元和 0.87 美元。缓存命中会便宜很多。一次长任务跑多少轮、塞进多少上下文、失败后重试几次,最后才决定账单。

Claude Code 的美国个人方案里,Pro 是每月 20 美元,Max 两档是 100 美元和 200 美元,也能改用 API 余额。Codex 的现行费率把输入、缓存输入和输出 token 折算为 credits,OpenAI 给出的平均估算约为每名开发者每月 100 至 200 美元,实际差异很大。

一个卖底盘和自带钥匙的模式,一个卖整车和油卡的模式,单看月费没有可比性。个人开发者还要把配置、排错和维护时间算进去。

回放让失败留下证据

DeepSeek Harness 另一项值得单独看的设计是 Trajectory。

模型看到的系统提示词、思维链、工具调用与结果、子 Agent 调度和上下文注入,都会进入仅追加会话日志。仅追加意味着旧记录不能被后来的步骤悄悄改写。恢复、分叉、检索与回放共用这条事件流。

长任务最怕一种失败。Agent 做了四十分钟,最后交出一个坏结果,用户只看见它说“已经完成”。中间哪一步读错文件,哪次工具返回报错,哪段上下文被压缩掉了,都要重新猜。Trajectory 至少把猜测变成检查。开发者可以回到某个状态,换一条路径继续,或者比较两个分支怎样走向不同结果。

展示可检查、可分叉和可回放所依赖的事件轨迹界面

回放也有边界。模型采样会变,网页会更新,外部 API 会返回不同数据,Shell 命令还可能在工作区外留下副作用。事件流能重建模型当时看到了什么,未必能让整个世界回到原位。它更像执行证据和恢复支点,不能当作确定性复现的保证。

独立研究给了一个更冷静的尺度。2026 年 5 月提交的 Harness-Bench 使用 106 个离线沙箱任务,记录了 5,194 条执行轨迹。研究者观察到,模型与 Harness 的不同组合会改变完成情况、过程质量、效率和失败方式。Agent 能力应当按“模型加 Harness”报告,单报模型名字会漏掉一半。

这项研究没有直接测试 DeepSeek Harness,也还只是预印本。它能支持的结论很有限。插件配置会影响结果。至于 DeepSeek 这套设计能提高多少成功率、增加多少延迟、节省多少成本,公开证据目前答不上来。产品刚开放两天,漂亮的社区案例也不该代替对照测试。

模型正在吃掉编排

Harness 今天作用很大,它现在的形态仍会改变。

DeepSeek 自己的 PTC 模式已经露出变化。传统 Agent 循环通常由外部代码安排。模型请求一个工具,系统执行,再把结果送回模型,然后开始下一轮。PTC 让模型写出 TypeScript 程序,在一次生成里组合多个工具调用。循环还在,编排的部分决定权已经进入模型生成的代码。

模型能处理的任务长度也在增加。METR 的 Time Horizon 1.1用软件任务对应的人类专家完成时长衡量难度,再拟合 Agent 的成功概率。2026 年 2 至 3 月的公开前沿系统,50% 成功率对应的任务跨度约为 12 小时,80% 成功率约为 1.5 小时。

提供与模型长任务能力相关、同时能看清测试口径的权威图

这张图很容易让人高估结果。12 小时指人类完成同类任务所需的时间,和 Agent 连续自主工作的时长无关。评测以软件任务为主,置信区间很宽,任务集也接近饱和。METR 还使用了两种 Agent Harness。它证明前沿系统能处理更长的任务,无法把进步全算在模型参数上。

另一组结果更能说明限制。LoopsBench v2在 112 个长周期编码任务上测试模型与循环实现。最强配置使用 Opus 4.7、Claude Code 和外层 continuation,只完成了 25%。记录下来的计划只覆盖部分依赖关系,运行中仍然出现回归。

模型会接手更多局部规划,也能在更长任务上保持目标。任务一旦涉及多阶段状态、权限、回归测试和失败恢复,外部系统仍在决定它能否交付。这两组材料分别说明了能力增长和当前上限。

我更愿意把未来的 Harness 分成两层看。

认知编排层回答下一步做什么。它包含任务分解、工具选择、上下文取舍、重试策略和子 Agent 分工。这些工作会越来越多地由模型生成。今天需要人手写的 preset,未来可能由模型根据任务临时拼出来,用完再丢掉。

控制与执行层回答允许做什么。它包含工作区边界、密钥隔离、审批、费用上限、审计记录和验证器。模型可以提出修改,最终边界仍要由独立系统执行。一个能自主选择资源的 Agent 权限更大,控制层承担的责任也更重。

所以 Harness 被吸收的画面,大概不会是一夜消失。它会像编译器优化一样退到后台。开发者很少手排寄存器和指令,编译器替人做了。内存保护、权限和运行日志仍在操作系统里,甚至比以前更严格。

第一个 Agent 应该小到能看懂

现在要不要试 DeepSeek Harness,我的答案是可以,任务要选小。

官方的一键入口只要求先装 Node.js,再运行 npx @deepseek-ai/dsh web。Web UI 启动后要配置模型密钥、添加工作区。需要审批的操作会先询问。源码开发的门槛高得多,官方当前要求 Node.js 22.19+ 或 24+、pnpm 11.7.0 和 Git 2.26+。第一次体验没必要先编译整个仓库。

可以挑一个没有发布权限的本地任务。比如读取一组公开资料,生成带来源的研究卡,再检查所有链接是否可打开。先用标准模式跑一遍,然后在创造模式里做一个 preset,只保留网页读取、文件写入和事实核查所需能力。相同任务再跑一次,比较 Trajectory、token 消耗、失败位置和最终文件。

这个实验不会立刻造出专属助理。它会让人亲手碰到 Agent 工程最有价值的部分。哪项能力来自模型,哪项来自工具,权限应该卡在哪里,失败以后拿什么证据复盘。读懂这四件事,比安装几十个社区插件更接近“组装 Agent”。

社区插件目前还要保守对待。官方版本处在快速迭代期,核心 API 会变。给陌生插件开放 Shell、文件和网络之前,先看源码和权限范围,最好放进单独工作区。便宜的 token 无法抵消一次误删、一次密钥泄露或一条无人检查的外部写入。

DeepSeek Harness 给个人开发者的机会很真实。过去藏在 Agent 产品团队内部的运行时选择,现在可以被看见、替换和回放。它的长期命运也没有产品页写得那么确定。

模型会继续吞下“下一步做什么”。“这一步允不允许做”仍要留给模型外面的系统。以后判断一种 Harness 有没有长期价值,可以只看这两句话分别由谁负责。

参考资料