DeepSeek Harness爆火,测试开发的下一个“版本答案”找到了!

举报
霍格沃兹测试 发表于 2026/08/27 19:06:36 2026/08/27
【摘要】 2026年8月13日深夜,DeepSeek把一个叫Harness的东西扔上了GitHub。6天,16.7万星。这个数字什么概念?Hacker News 740分,评论区吵了上千楼。测试圈更热闹——有人失眠,有人焦虑,有人连夜装上了。我属于第三种。熬了一整夜测完,只想说一句:这东西跟你想的不一样。 一、先别慌,搞清楚Harness到底是啥很多人第一次看到“Harness”这个词会懵。直译是“马...

2026年8月13日深夜,DeepSeek把一个叫Harness的东西扔上了GitHub。6天,16.7万星。

这个数字什么概念?Hacker News 740分,评论区吵了上千楼。测试圈更热闹——有人失眠,有人焦虑,有人连夜装上了。

我属于第三种。熬了一整夜测完,只想说一句:这东西跟你想的不一样。

一、先别慌,搞清楚Harness到底是啥

很多人第一次看到“Harness”这个词会懵。直译是“马具”——套在马身上那套缰绳。

这个比喻特别准:模型是马力很强的马,但你没法直接控制它往哪跑;Harness就是那套缰绳和车厢,负责把模型和组织文件、执行命令、调用工具、管理上下文这些“让马真正拉车干活”的组件绑在一起。

DeepSeek官网给了一个很干脆的等式:

Model + Harness = Agent

模型是大脑,负责思考和推理。Harness是手脚+神经系统——读文件、调工具、执行命令、持续完成任务。

以前你调API拿到的是颗“大脑”,现在它顺手递给你一套“手脚”。

但有个坑很多人踩了:DeepSeek V4是模型,DeepSeek Harness是让模型干活的“操作系统层”,它俩不是一回事。叫Code的(Claude Code、Codex)定位是AI编程助手;而Harness的定位是更底层的 “Agent执行底座” ——编码只是它官方预置的一套组合,你完全可以用它拼出跟编程毫无关系的Agent。

Claude Code、Codex这类产品本质上是把Harness那一层做成了闭源成品——工具、Skill、会话管理、沙箱全被厂商封装进一个壳里,你用的是精装房,墙不能拆、格局不能动。DeepSeek这次干的事,等于把这套房子的施工图和所有预制件都开源了,还告诉你“墙随便拆,零件随便换”

二、核心设计:“一切皆插件”不是营销话术

Harness最核心的设计理念只有五个字:一切皆插件(Everything is a Plugin)

这不是一句营销话术。

过去的Agent框架像一个固定浇筑的大楼——核心Harness是固定的,用户只能在边缘加插件。DeepSeek Harness把这栋固定的大楼拆成了一盒乐高

不只是外围能力可以插件化,连模型适配器、工具注册表、会话日志、Agent Loop本身,全都可以替换

官方用了一句非常硬核的话:

“不存在需要打补丁的特权内核”——扩展dsh的方式就是把插件挂载到其他插件旁边。

什么意思?你不用fork官方代码仓库去改核心逻辑,所有扩展都通过插件机制完成。你想换掉整个Agent的运行方式,写个插件就行,不用动源码。

支撑这套架构的底层,是一个叫Cordis的元框架。它来自DeepSeek与北京大学联合发表的论文《A Programming Paradigm for Spatiotemporal Composability》。这套设计已经在Koishi聊天机器人框架中运行了四年,超过4000个社区插件在生产环境中验证过。

更狠的一点:Harness在设计上完全不绑定DeepSeek自家模型。OpenAI、Anthropic、AWS Bedrock、Azure、Gemini全都能接。甚至可以把Claude Code和Codex作为子Agent调用——通过解析PATH里的对应二进制文件实现委托执行。这意味着你可以用Harness做上层编排,把Claude Code和Codex纳入更大的工作流,而不是取代它们。

三、30分钟上手:从安装到跑通第一个测试任务

先泼盆冷水:官方文档以架构说明为主,缺少一条从零上手的路径。打开GitHub仓库,全是AGENTS.mdarchitecture.md——对新手不太友好。

下面是我踩完坑整理出来的实操流程。

3.1 装Node.js(2分钟)

DeepSeek Harness需要Node.js环境,要求版本 ≥ 22。

node --version

如果看到v22.x或更高,OK。没有的话去Node.js官网下载LTS版本。

3.2 一条命令安装DSH(2分钟)

npx @deepseek-ai/dsh web

这条命令会自动下载并启动Web UI。首次运行需要等一两分钟下载依赖。

验证安装:

dsh --version
# 当前版本 0.1.0-rc.8

Windows用户注意:装完如果提示找不到命令,重新打开一次PowerShell。

不想折腾命令行的还有两个选择:

  • 桌面版:社区打包的DeepSeekHarness-win32-x64压缩包,解压即用
  • Dockerdocker run -d --name dsh -p 3080:3080 ghcr.io/huoxue1/deepseek-...

3.3 启动Web UI(1分钟)

npx @deepseek-ai/dsh web

界面风格从蓝色变成了黑色,LOGO从蓝鲸换成了黑鲸——据说这是要把Harness当独立生态经营的信号。

3.4 配置API Key(2分钟)

先去DeepSeek开放平台买Token、获取API Key。

配置方式:

export DEEPSEEK_API_KEY=sk-xxxx  # Linux/macOS
$env:DEEPSEEK_API_KEY="sk-xxxx"   # Windows PowerShell

不一定非要用DeepSeek的模型。Harness通过LLM适配器可以接OpenAI、Anthropic等各种模型。

3.5 四种运行模式选哪个?

点击对话框的模式选择,能看到四种预设:

模式 说明 适用场景
标准模式 功能完整的编码Agent,支持文件编辑、Shell、Skills、子Agent 日常开发,测试任务首选
PTC模式 先让模型生成脚本再执行 批量操作、需要预先审查的场景
极简模式 只有bash和文件编辑两个工具 基准测试,普通用户基本用不到
创造模式 可以创建自定义Agent预设 高级玩家——用Agent造Agent

测试任务直接选标准模式

3.6 装测试插件,跑起来

社区已经有人做了dsh-test-runner插件——让Agent一次工具调用就能完成 “改代码→跑测试→修”的完整闭环

安装方式:

dsh plugin --profile <name> add dsh-test-runner

还有dsh-browser-playwright插件,基于Playwright的浏览器自动化工具。每次操作返回当前页面的可访问性快照(带ref标识),后续click/fill直接用ref定位,确定性强、token省

截至8月18日,以dsh-plugin标签发布的社区插件已有数百个,公开仓库超过700个。

四、实测:AI到底能替测试开发干多少活?

有开发者把日常工作拆成五个环节,逐项交给dsh做了一遍:

需求解析(替代度约50%) :文档写得清楚,它提取得就齐——入参、出参、错误码都能列出来。但“库存为零不允许出库”这类没写进文档、只存在于业务方脑子里的规则,它不会凭空知道。

用例设计(替代度约70%) :最省人的一环。它给的是具体可执行的用例描述,不是“测试正常流程”这种正确的废话。边界值会主动凑成对(刚好等于阈值、刚过阈值各一条),异常场景也知道往负数、超长字符串、缺字段上想。

脚本编写(替代度约60%) :形态不错,会用fixture、会参数化,断言具体到状态码。但会偶发编出不存在的接口,或者假设错返回结构,每一条都要人看

执行调度(替代度约30%) :短板很明显——响应速度偏慢;任务链一长就容易不稳,遇到过循环打转,反复读同一份日志不往前走。

缺陷定位(替代度约40%) :能从日志里圈出可疑点并给假设,但确认还得靠人。

综合替代度约50%-67% ——AI擅长重复劳动,判断力仍属人类。

五、为什么说它是测试开发的“版本答案”?

5.1 从“写脚本”到“管Agent”

过去测试开发的核心工作是写自动化脚本。现在Harness把执行层全包了——它自己读代码、自己跑测试、自己分析失败原因、把修复方案列出来。

你的价值从“写脚本”变成了“管Agent” :选什么模型、配什么插件、定义什么规则、怎么审计结果。

5.2 “一切皆插件”带来的工程化可能

Harness最被低估的一点:它不是消费品,是基础设施

你可以:

  • 把内部的测试框架封装成Harness插件
  • 把公司自建的模型服务通过自定义接口接入
  • 把Claude Code和Codex作为子Agent编排进同一个工作流
  • 用Headless模式跑批量任务,适合CI/CD流水线

这些在Claude Code里根本做不到。

5.3 Trajectory全链路追踪,测试可观测性的新范式

Harness维护一份只追加写入的会话日志——所有抵达模型请求的内容都必须可从该日志中还原。恢复、分叉、回放、转录、遥测,全建立在这一事件流之上。

对测试来说这意味着什么? AI跑的每一步都有记录,出了问题随时复盘,相当于自带测试报告。你再也不用猜“AI当时是怎么想的”——Trajectory里全写着。

六、几个避坑指南

1. 当前是开发者预览版,官方明确警告存在breaking changes,不保证向下兼容。别在生产环境乱搞。

2. 模型成本要算清楚。V4系列API改为峰谷分时计价,高峰时段价格明显上浮。Harness跑长任务时token消耗不小,建议先用小模型试水。

3. 生成的结果必须评审。实测中AI会编出不存在的接口、假设错返回结构。“生成完先跑一遍,红的先人工分类——是代码错还是用例错——再决定改哪边。”

4. 选对预设很重要。写代码、做测试、修Bug,不同类型的任务适合不同的模式,选错了可能事倍功半。图快就用极简模式,正经干活用标准模式。

写在最后

Harness开源6天16.7万星,这个速度在开发者工具史上都是罕见的。有人把它叫做 “Agent领域的Linux时刻”

是不是Linux时刻不好说,但有一点是确定的:测试开发的玩法确实要变了

以前你的核心竞争力是“能写自动化脚本”。以后这可能只是基本功。新的护城河是:你能不能搭一套让AI帮你跑测试的工程体系?能不能判断AI生成的结果靠不靠谱?能不能把测试经验和业务理解转化成Agent的规则和插件?

Harness给了你一把扳手。用它拧螺丝,还是用它造一台能自己拧螺丝的机器——取决于你。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。