DeepSeek Harness 原生 Agent 框架首发深度评测:从安装到实战,3 小时压测全记录
DeepSeek 这次玩了个大的。梁圣上午刚发 V4 Pro 正式版,晚上 Harness 就跟进了。模型和编排框架同日上线,这节奏确实不给人留缓冲期。
我花 3 小时把 DeepSeek Harness 从头到尾跑了一遍,以下是实测报告。
一、快速上手指南
安装命令很直接,通过 npm 官方包即可获取:
npm install @deepseek-ai/dsh
实测安装版本为 0.1.0-rc.6。安装完成后,可通过以下命令验证:
dsh --help
dsh --profile headless "your task"
dsh web
dsh web 会启动 Web UI,浏览器中即可访问图形化界面。
二、核心功能架构解析
Harness 的定位很清晰——一套完整的 Agent 执行框架。从功能模块来看,它覆盖了 Agent 落地的全部核心能力:
-
文件系统操作:读取和修改工作区文件 -
命令执行:在沙箱环境中运行 Shell 命令 -
网络检索:搜索网页、调用外部工具 -
Skills 管理:可插拔的技能扩展机制 -
任务编排:计划管理、上下文维护、多子代理协同 -
会话与权限:会话追踪、权限控制、运行轨迹记录
界面设计走的是极简路线,但功能入口一个不少。
三、四种运行模式:该选哪个?
这是 Harness 最有意思的设计——四种模式覆盖了从通用到专用的全部场景:
|
|
|
|
|---|---|---|
| 标准模式 |
|
|
| PTC 模式 |
|
|
| 极简模式 |
|
|
| 创造模式 |
|
|
官方反复强调的设计理念是「一切皆插件」——模型、工具、Skills、会话、文件系统、沙箱、多 Agent 协作,甚至 UI 本身都可以拆开重组。比如你可以通过插件给 Harness 加一个任务进度面板,运行时直接显示在界面里,不用时随时停用。
这套架构的扩展性值得后续单独深挖。
四、实测 Case 1:3D 黑洞引力模拟器
统一使用 DeepSeek V4 Pro 模型,接入 Claude Harness、DeepSeek Harness 和 Hermes Harness 进行横向对比。
结果汇总:
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
这个 Case 的关键结论是:Harness 本身对模型任务执行的影响显著。同样的模型、不同的编排框架,输出质量存在实质差异。
DeepSeek Harness 在速度上与 Claude 还有差距,但效果基本持平。考虑到当前还是预览版,这个表现已经超出预期。
五、实测 Case 2:创造模式实战——门店宣传助手
创造模式的核心逻辑是:先配 Agent,再让 Agent 干活。我把这个模式跑了一遍,验证它能不能落地。
预设配置:创建了一个面向小店老板(不懂代码)的宣传网页生成 Agent,以标准模式为基础,保留文件读写、命令执行、网页检索等能力,额外约束了三点:
-
开始前最多问 3 个关键问题(店名、主营产品、宣传风格) -
网页必须适配手机浏览 -
完成后自动启动检查并反馈文件清单
踩坑实录:任务执行过程中,Agent 一度陷入 Bash noop 死循环——思考链里已经意识到应该调用 preset_ops,但下一步又回到同一个占位动作。手动终止后追问原因,它改用文件系统路径继续操作,最终生成了预设文件并通过加载检查。
最终效果:新建会话后,「门店宣传助手」直接出现在模式选择列表中。我只给了一句不完整的需求("帮我给新开的甜品店做一个宣传网页"),它主动补问了 3 个关键信息,完成网页生成+检查,总用时 3 分钟。
创造模式的价值判断:偶尔做一次网页,标准模式足够。但如果你经常处理同类任务(比如每周给不同客户出宣传页),预设好规则后每次都能省掉重复沟通成本。适合创作者、小团队,以及想研究 Agent 工具链配置的人。
六、实测 Case 3:复杂数据处理压测
最后跑了一个数据量较大的处理任务。将 DeepSeek V4 Pro 分别接入 WorkBuddy 和原生 Harness,执行几乎相同的任务。
WorkBuddy(处理四川卷下) :33 分钟完成,不仅跑通了流程,还主动发现了已有处理流程中的问题并给出修改建议。
DeepSeek 原生 Harness(处理四川卷上) :跑了 20 分钟后报错中断,重新继续后总计耗时近 50 分钟完成。产出数据质量与前者一致,没问题。
坦白说,这个结果没达到预期。原本以为模型接入自家框架会有加成,实际在稳定性(首次报错)和执行效率(50min vs 33min)上都不如接入成熟平台。
七、总结与展望
三小时测下来,我对 DeepSeek Harness 的判断是这样的:
亮点:
-
四种模式的设计思路清晰,覆盖场景完整 -
「一切皆插件」的架构理念扩展性强 -
创造模式确实能落地,不是噱头 -
任务执行质量没问题,效果与 Claude 持平
待改进:
-
执行效率明显偏低(同样任务比成熟平台慢 30-50%) -
稳定性有隐患(复杂任务首次执行报错) -
个别场景存在死循环问题
DeepSeek 官方明确表示当前是公测阶段。模型能力已经证明了上限,Harness 需要的是时间打磨稳定性和效率。我会持续关注正式版的表现。
- 点赞
- 收藏
- 关注作者
评论(0)