别只盯着 V4 跑分:DeepSeek Harness 想重写 Agent 的“马鞍和缰绳”

DeepSeek Harness 目前仍像毛坯,但其“一切皆插件”的架构,指向的是可观测、可改造、可自我迭代的 Agent 运行时,而非又一个开箱即用产品。


DeepSeek Harness 发布:大家都在吵性能,我更在意它到底要做什么

2026 年 8 月 13 日晚,DeepSeek 开源了 DeepSeek Harness(命令行叫 dsh),MIT 协议,仓库一上线不到一天就冲到数万 star。同一天发布的还有 V4-Pro 正式版。模型加工具链一起放出,本来想凑个"双响炮"的声势,结果社区吵翻了。

大部分人盯着 V4 的跑分和涨价,说"满血版没预想中那么强"。但我把知乎上几篇长文从头读到尾,加上自己翻了翻架构文档,得出来的感觉不太一样:我们可能正在用上一阶段的尺子,量下一阶段的竞争。

先泼一盆冷水:它现在确实像个毛坯

看到它的第一反应普遍是懵。内测开发者 Kitt在进化 拿到产品时说,左边菜单栏就一个工作区目录和一个新增对话按钮,插件管理、定时任务、内置浏览器、computer-use 全都没有,设置页只有外观和模型两项。他当时心里想的是:"一个 agent 产品,这些东西现在不都是标配吗?这玩意离完工是不是还挺远。"

段小草说得更直白:需要 npm install 才能用,本身就把非程序员用户挡在门外了,"相比于现在的毛胚状态,希望能更加开箱即用"。他还吐槽内测秀出来的插件大多是自嗨,"用户是来看你给黑鲸鱼换皮肤的吗?用户是想看到怎么把模型能力榨干到极致。不搁这造生产力,秀各种风格的皮肤有啥用?"

这些都是实打实的批评,我认。

但架构这件事,是真的有点东西

如果你只盯着产品用起来顺不顺手,那确实会失望。问题是 DeepSeek 根本没打算把它做成一个"开箱即用"的成品。Kitt 后来才明白:"DSH 根本就没打算自己做这些功能,走的是插件路线,自己只搭框架,所有能力交给社区自定义。"

这就是它最大的卖点:一切皆插件。模型适配器、工具注册表、会话日志,甚至 Agent 主循环本身,全都是可替换的插件。底层是 Cordis 框架,讲究"注册即副作用,卸载即回滚",没有需要打补丁的特权核心。

酱紫君用一个比喻把这件事说透了。他把大模型比作一匹马,Cursor、Claude Code 这类客户端是马车车厢,而 Harness 是马鞍和缰绳——连接马的力量和车厢的那层东西。他说现在的所谓 Harness 其实都是"单片机":所有逻辑焊死在一个 while true { loop } 里,开局塞一段巨长 prompt,设定角色,喂工具 JSON Schema,模型输出 Tool Call,客户端跑一段代码喂回去,周而复始。

DeepSeek 觉得这太挤了。他们要的是一套能让模型自省、动态插拔、在运行时自己改写自己插件树的抽象运行时。用他的话讲,现在的 Harness 好比 Linus 刚写的 Linux 0.01 内核,啥也没有,但方向已经摆在那了。

最有争议的一层:这到底是开源情结,还是生意

见仁见智。有人的角度很冷,说这是披着开源外衣的商业模式:开源运行时吸引开发者,但每个 agent 任务都要消耗 token,DeepSeek 收 API 费,跟 Redis 开源 + Redis Cloud 赚钱一个套路。

这个质疑成立,但也别把它想得太黑暗。DeepSeek 之前只开源了模型的半边,Harness 一直没动静,这次补齐,算是把"模型到干活"这段闭环整个摊开给所有人。身份上也有意思:之前讲 harness 的多是工具厂商和社区,这次是模型厂商亲自下场——模型通常按自家 harness 做过训练适配,理论上能压榨出别人 harness 用不出来的能力。

我更在意的那件事:自我迭代的可能性

现在聊聊为什么我觉得不该只盯着产品形态和跑分。

SeanTan 那篇长文(标题就叫《当大家失望于 DeepSeek V4 时,我更关注它刚刚开源的 Harness》)点出了一个被大多数人忽略的事。他说我们习惯用"大脑够不够聪明"来评判一家 AI 公司——DeepSeek 有没有造出一个足够聪明的大脑?但 DeepSeek 正在做的可能是另一件不同层面的事:

如果单个大脑暂时没那么聪明,能不能制造一个会组织自己、改造自己,甚至逐渐学会迭代自己的智能系统?

他把 Agent 能力拆成乘积:模型 × Harness × 工具 × 记忆 × 环境 × 计算资源。模型只是其中一个因子。DSH 加上那个 append-only 的 Session Log(每次运行都可追溯,模型看到的所有内容都被记录下来),本质上是在给这个系统装"眼睛"和"记忆"。你能看到 agent 看到什么、为什么这么决策、结果如何复现。

他感慨,构成"运行 → 观察自己 → 找到缺陷 → 修改自己 → 测试 → 保留改进 → 用更好的自己继续运行"这个反馈环的零件,正在一件一件出现。Coding 让 AI 能改软件,Trajectory 给了它经验数据,Verifier 让它判断改得好不好,Cordis 提供了可控的模块化变异边界,Harness 则提供了一个可以被修改的软件身体。

有答主三风说得更极端也更直接:"从产品的角度来说纯史一坨,给任何模型装上都纯 debuff。但从 Agent 的角度来说,这是一个前所未有的自进化框架。如果梁子能在这玩意上跑通 RL,训出来的模型确实有望在 AGI 上超车。"

我不完全同意"纯史一坨"这个说法,他明显是因为 V4 失望夹带了情绪。但"DSH 的最大价值不在当下性能,而在它是一个可以用来训练更好 agent 的自进化框架"这一点,我认同。

我的结论

DSH 现在确实不好用,对普通用户不友好,插件大多还是自嗨,官方也明确说还在 developer preview,会有破坏性变更。这些都不是假装看不见的问题。

但我整体的感觉是:DeepSeek 这次卖的其实是架构和方向,不是开箱即用的成品。它把"马鞍"做成了一套能让模型自己换零件、甚至自己改自己的系统。Claude Code 和 Codex 是产品,给你一个现成的 agent;DSH 是地基,给你一堆零件让你组自己的 agent,然后动手改。

好消息是,模型能力也在快速跟上。V4-Pro 那套数字(84% 的缓存命中率、实测 33 秒跑完一个任务、84% 输入主要是系统提示)说明运行本身已经相当高效。差的只是"人味"层面的打磨和生态的沉淀——这恰恰是社区最擅长补的部分。

DeepSeek 是不是在憋一个更大的东西,能不能在"自进化"这条路上跑通,现在谁也没法打包票。DSH 可能最后被 Claude Code 或别的框架压过去,Cordis 也可能没成行业标准。但即使它失败,它指向的问题还在:下一阶段的竞争,很可能不是"谁的大脑更聪明",而是"谁能把这些大脑组织成一个持续运行、动态重组、不断积累经验、甚至开始修改自身结构的系统"。

到那时候回看,V4 某个 benchmark 比对手低几分,可能只是个很小的历史注脚。


注:文中观点整理自知乎答主 Kitt在进化、段小草、酱紫君、SeanTan又名阿卉、三风等的公开发帖,数据与"缓存命中率 84%"等来自答主"体验生活的张三"的实测。均为发布于 8 月 13-14 日的个人观点,含内测开发者的一手体验,部分对 V4 的吐槽带有个人情绪,请自行判断。