AI 模型与行业动态

读懂 DeepSeek Harness:什么是 agent harness,为什么它才是决定成败的那一层

2026-08-14·8 分钟阅读
DeepSeek Harness——「一切皆插件」的开源 agent harness

2026 年 8 月 1 日那个周末,DeepSeek 开源了 DeepSeek Harness——简称 dsh——并开始招募外部开发者来一起折腾它。它采用 MIT 许可,明确标注为开发者预览版,两周内在 GitHub 上超过 3.3 万 star。有意思的地方不是 star 数,而是:一家最为人所知的标签是「便宜又能打的模型」的实验室,这次拿出来的不是又一个模型,而是模型**上面**的那一层。那一层叫 harness,大多数人从来不需要想它;而 8 月 11 日发布的一份基准测试显示,它对成功率的影响,可能比换模型还大。下面把 dsh 是什么、harness 干什么、以及这件事为什么突然变成兵家必争,讲清楚。

先说清楚:agent harness 是什么

模型本身只做一件事:文字进、文字出。它读不了你的文件、跑不了命令、记不住二十分钟前发生了什么,也意识不到自己卡住了。你以为「AI 智能体在干活」的那一切,其实都是包在模型外面的软件在干。这层包装就是 harness。它握着那个决定「什么时候调工具、什么时候停下」的循环、工具本身的定义、命令实际执行的沙箱、这一次会话的记忆,以及「哪些内容要塞回下一轮提示词」的规则。Claude Code、Codex、OpenCode 都是 harness。模型是发动机,harness 是这辆车的其余全部。

这个区分值得记牢,因为它解释了一个很常见又很费解的体验:同一个模型,在这个工具里聪明得不行,换个工具就笨得要命。多数情况下模型是同一个。变的是 harness 往它面前放了多少代码、命令失败后允不允许它重试,以及有没有在中途悄悄把上下文截断掉。

相关阅读:开源权重改变了什么

DeepSeek 这次到底放出了什么

dsh 建在一个叫 Cordis 的内核上,由它负责插件的挂载、卸载和依赖解析。之上是那句设计口号:一切皆插件。可插拔的有九类——模型、工具、技能、会话、沙箱、存储、循环、调度、界面。注意这份清单里都有什么:**循环**是插件,**界面**是插件,连**模型**都是插件——也就是说,尽管顶着 DeepSeek 的名字,dsh 并没有绑死在 DeepSeek 自家模型上。

第二条明示的原则关注度低得多,但可能更实用:**每一次运行都可追溯**。dsh 维护一份只追加(append-only)的会话日志,记录系统提示词、推理过程、工具调用,以及每一次上下文注入。凡是见过智能体干出莫名其妙的事、却完全无法还原「它当时到底看到了什么」的人,都会明白这有多值钱。多数 harness 给你的是一份整理过的过程摘要;而一份只追加的、记录「实际发出去的内容」的日志是另一回事——这是「调试一个智能体」和「猜一个智能体」的区别。

让人开始重视这层的那份基准测试

2026 年 8 月 11 日,Composio 发布了一份 harness 横评,值得细读。他们让八个 harness 跑 30 个跨应用的高难度工作流——Airtable、Gmail、Google 日历、Sheets、GitHub、Slack、PostHog——每个任务上限 900 秒,判定用**程序化的严格通过/失败**检查,而不是让另一个大模型来打分。240 次运行整体通过率 53.8%。真正的发现是 harness 之间的差距:最低 46.7%,最高 66.7%。

成本的差距更大。每成功一次的花费从 $0.028 到 $0.195——**七倍**——每个任务的 token 消耗从约 19.2 万到 140 万。同一类任务、同一代模型,仅仅是模型外面这层包装,就造成了七倍的成本差。而完成时间的中位数反而挤得很近,大约在 123 到 272 秒之间——这说明差距不在「跑得快不快」,而在 harness 把每一轮花得有多值。

有一条必须老实交代:**dsh 不在这份横评里**。参测的八个是 Pi Agent、Prime Agent、OMP、Claude Code、Codex、DeepAgents、Hermes Agent、OpenCode。所以目前还没有 DeepSeek Harness 的公开对比数据,谁跟你说它「已经超过 Claude Code」,那是编的。这份基准确立的是**前提**而不是**冠军**:harness 这一层值这么多分,所以一家实验室才会派工程师去做它。

怎么试,以及它其实适合谁

上手门槛刻意压得很低。装好 Node.js 后,`npx @deepseek-ai/dsh web` 就会启动网页界面,默认地址 http://127.0.0.1:3080。想要源码就 clone 仓库,然后 `pnpm install`、`pnpm run build`、`pnpm dsh web`。不用注册、不用付费——harness 本身是 MIT 许可的。你仍然要付你接进去的那个模型厂商的钱,那笔账完全是另一回事。

接下来是宣传里不会放在前面的部分。仓库用大写字母写明:**会有破坏兼容性的改动**;这是开发者预览版,DeepSeek 自己的定位就是号召外部开发者一起把它打磨硬。翻译一下:如果你是做框架的、做智能体基础设施的,或者想早点写个插件并让它真的产生影响,现在是好时机。如果你只是想要一个今天就能稳定改代码的助手,一个成熟的 harness 会少浪费你一周时间。这是两件真的不同的事,答案取决于你是哪一种。

为什么实验室要去做 harness,而不是再做一个模型

DeepSeek 的 V4 Flash 给行业带去了一轮成本效率上的冲击,而在 CEO 梁文锋的路线里,「又便宜又能打」一直被当作通往 AGI 的路径。带 harness 团队的崔天翼在社交媒体上宣布了 dsh,并且据报道公开在招人,因为团队人手不足。这个组合透露了一些信息:harness 不是「帮你用我们模型」的附属项目,而是被当成一个真正能出成果的方向。

它也符合一个很直白的经济逻辑。如果 harness 能让通过率差二十个百分点、成本差七倍,那么定义 harness 的人,就定义了模型的能力最终有多少真正落到用户手里——而用 MIT 开源出去,正是让所有人的插件都照着**你的**设计去写、而不是照着别人的。这跟开源权重在模型层玩的是同一套打法,只是往上挪了一层。

查看模型阵容

如果你是做图做视频的,这意味着什么

先给直接答案:dsh 不会替你生成一张图。它是给语言模型做多步骤工作用的 harness——代码、文件、API 调用、工作流。它不是图片或视频生成器,JoyInAIGC 也不是跑在它上面的。两者在不同的层上。看待它最有用的方式,还是当初讲 Kimi K3 时那个两层划分:一个决定「做什么」的推理层,一个真正把像素做出来的生成层。而 harness,是让推理层能真的**动手**、而不只是**说说**的那套机械。

两者真正的交汇点在**工具边界**。图片和视频生成,对一个 harness 来说只是它能调用的又一个工具——正因如此,「读这周的 SKU 清单、给每个商品写好提示词、把主图渲染出来、丢进一个文件夹」这种事,才从研究问题变成了管道问题。如果你想在不写任何插件的前提下,今天就看看这套模式是怎么跑的,本站的批量模板做的就是这件事:固定的提示词结构、一个商品一个商品来、产出稳定。harness 那边在做的是把这个思路一般化;而这套工作流本身,你现在就能跑。

打开商品图模板

结论

对多数人来说,dsh 这件事的实用启示不是「快去装一个」,而是:当一个 AI 工具让你失望时,出问题的往往不是模型。在换模型之前,先看看这个工具究竟给了模型什么——多少上下文、允许几次重试、开了哪些工具,以及你能不能看到日志。DeepSeek 把这一层做成开放且可检视的,即使对永远不会去跑它的人也有意义:它把一个厂商们各自暗中较劲的黑箱,变成了我们其余人能读的东西。

自己试一下

DeepSeek 开源了 dsh——一个 MIT 许可、以「一切皆插件」为原则的 agent harness。这篇讲清 harness 到底是什么、它和模型有什么区别、首批公开基准说明了什么,以及怎么上手试。

试试对话模型

常见问题

一句话说清,agent harness 是什么?

它是包在语言模型外面的那层软件:给模型工具、给工具一个运行的沙箱、给这次会话记忆,以及一个决定「何时行动、何时停下」的循环——把「文字进、文字出」变成一个真能干活的智能体的,就是这些。

DeepSeek Harness 是免费开源的吗?

是的——harness 以 MIT 许可发布,含源码。但「运行起来」不是免费的:dsh 调用的是你自己配置的模型,那部分照常按 token 付给模型厂商。

怎么安装和运行 DeepSeek Harness?

装好 Node.js 后执行 `npx @deepseek-ai/dsh web`,网页界面默认在 http://127.0.0.1:3080。用源码:clone 仓库,然后依次 `pnpm install`、`pnpm run build`、`pnpm dsh web`。

它能取代 Claude Code 或 Codex 了吗?

日常生产使用还不到时候。仓库自己用大写字母警告会有破坏性变更,并且明确标注为开发者预览版。目前也没有包含 dsh 的公开横评数据,所以任何「它已经赢了成熟 harness」的说法,现在都缺乏依据。

harness 会让模型变聪明吗?

不会——它不改变模型的权重。但它决定了模型的能力有多少能真正抵达任务。在 Composio 于 2026 年 8 月对八个 harness、30 个工作流的横评里,通过率从 46.7% 到 66.7%,每成功一次的成本从 $0.028 到 $0.195——对一个「模型之外」的东西来说,这个差距相当大。

JoyInAIGC 用了 DeepSeek Harness 吗?

没有。JoyInAIGC 是做图片、视频、音频生成的平台;dsh 是给语言模型做多步骤任务用的 harness。两者在不同的层、解决不同的问题。用推理类工具去规划和写提示词,再到这里把画面生成出来。

相关阅读

读懂 DeepSeek Harness:什么是 agent harness,为什么它才是决定成败的那一层 — JoyInAIGC