图片由AI生成
国内时间八月十三日晚间,DeepSeek向全球开发者社区推出了Harness的开发者预览版本,同时基于MIT许可协议对源代码进行了开放共享。
相比业界常见的模型权重发布做法,此番DeepSeek披露的是支撑Agent运行的完整基础设施体系,涵盖了模型、工具、技能、会话、沙箱、存储、Agent循环、任务调度及用户界面等多个层面,这些要素均被设计为可加载、可卸载或可互换的插件形式。
DeepSeek通过一句容易被广泛传播的口号来诠释这套架构理念:万物皆可作为插件。
特别需要注意的是,DeepSeek针对Harness在微信平台创立了独立的公众号「DeepSeek Harness团队」。该账号采用黑色鲸鱼作为视觉标志,与既有模型产品所采用的蓝色鲸鱼形象构成了明显的视觉差异。
这种独立的品牌划分背后,反映了DeepSeek可能希望为Harness开辟一条独属于自己的开发者交流通道,并在此基础上长期建设相关生态。当模型被应用于真实场景执行连续性任务时,其表现愈加受制于模型之外的运行框架:框架掌控了模型所接收的上下文信息,决定了模型能调用的工具集,规定了失败应对措施,管理了任务是否可继续执行,制定了高风险操作的审批流程,以及负责防止长期运行中出现的目标偏移。Harness正是这个重要的链接层,它实现了模型与这些系统能力的有机融合。
通过Harness,开发者获得了像组装积木般灵活组合Agent的能力,这同时意味着DeepSeek的开源范畴已从单纯的模型升级到了整个Agent工程框架。

01
模型能力之外,为什么还需要Harness
语言大模型的核心职责仅限于预测并生成序列中的后续内容。要构建一个具备文件读写、命令执行、外部服务调用、子Agent派遣以及基于执行反馈继续运作能力的Agent系统,需要配备一套不间断运行的控制框架。
Anthropic曾将Agent的核心模块定义为:融合了搜索、工具和记忆强化的语言大模型。当涉及长时间跨度的任务时,Harness的职责进一步扩展至上下文协调、权限管理、状态记录、异常处理及终止条件界定。Anthropic于2026年四月针对Agent托管方案做出的补充阐述表明,Harness体现了开发者关于「模型无法独立完成的工作」的认知判断,而随着模型性能的进步,这些认知也会逐步失效。
这揭示了Harness设计中一对根本性的张力:一方面框架必须给予充分的控制机制,另一方面又不应以生硬呆板的流程来束缚模型的表现。
这也阐明了DeepSeek为何如此重视可互换性的设计。将相同的模型部署在不同的Harness框架中,其最终的执行效果往往存在显著差别。系统级提示词的组织方式、工具说明的准确程度、上下文的压缩时机、失败重试机制的有无,这些要素对任务完成率、Token耗量以及总耗时都会产生直接影响。
伴随模型评估的重心从单轮对话逐步转移至实际工程问题的解决,Harness框架自身演变成了评测中不可忽视的变量因素。
当前这个技术层级已集聚多种技术方案。OpenAI Agents SDK着眼于工具、Agent切换、防护、会话记录与追踪能力;Claude Agent SDK公开了Claude Code所用的工具库、Agent执行循环及上下文处理方案;LangGraph重点放在了持久化运算、人工干预及状态复原。DeepSeek Harness步入的是已有多家成熟方案的市场空间,其独特之处在于将上述能力纵向细分为可通过配置灵活组装的插件形态。
02
「一切皆插件」?
Cordis插件系统为DeepSeek Harness的建设提供了基础。按照官方说明文档所述,模型适配器、工具库、会话记录、乃至Agent运行循环等要素均作为插件而存在,开发者可以不触及Harness核心代码的前提下,经由插件的替换或增强来实现能力的调整与拓展。
Cordis把这项特性命名为「时空可组合性」。其中「时间」维度涵盖:插件移除时,该插件曾注册的各项服务、触发事件及衍生效应均得以撤回;「空间」维度则指:插件能够说明自身依赖关系,当其他组件变动时可重新协调彼此的作用方式。
发布于八月十三日的Cordis学术论文目前仍处于不断完善的预印稿阶段,其核心机制涵盖了作用追踪、依赖处理、参数同步及热加载等功能。显然,这一方案的适用范围已超越了常规意义的插件框架,扩展至「具备自主优化能力的Agent运行框架」领域。

这种细粒度的拆分对开发者而言呈现出三个方面的直接好处。
其一,模型层与执行环境可实现彻底剥离。开发者既可以维持住同样的会话机制、工具集和权限策略,独立更换模型连接器;也可以保持模型不变,对比研究各异的上下文协调策略或Agent循环逻辑的实际表现。在模型性能测评的语境中,这使得能够准确判断:模型性能增长源于模型自身进阶,还是源于工程侧的优化。
其二,企业能够维系原有的技术栈。隔离运算、数据存储、审核机制、身份凭证及监测数据等环节均可被设计成插件模块,理论上可整合进内部的权限管理与审查流程,从而降低被某一Agent方案的技术栈锁定的风险。
其三,Agent的各项能力可形成具有独立性的生态体系。开发者无须耗费资源维护DeepSeek Harness的定制分支版本,仅需对外公开相应的插件即可。官方已提出建议在插件库中附加dsh-plugin标记,该举措将助推一个可被检索、可被再利用的插件库的逐步发展。
同时,这套架构也将相应的风险转移到了插件生态中。工具类插件可访问文件系统与外界服务,存储类插件掌控了全部会话数据,循环类插件可左右Agent的行为选择。对插件源进行身份核查、规划权限界线、处置依赖冲突、确保版本适配及防护供应链威胁,这些都成为生态走向生产实用的必要前提。开放的广度越大,对应的治理投入也会越多。
03
四种模式,实际上是四种Agent实验方法
根据官方材料,DeepSeek Harness预先设置了四种运行策略:分别为标准、PTC、极简以及创意,各自加载了不同的插件集合,并服务于相异的开发需求。

标准策略汇聚了相当全面的工具支持,适用于常规Agent开发工作。极简策略则限制为仅保留命令行与文件编辑两项工具,主要供基准对标之用。此法最大程度地规避了外围工具的影响干扰,让评估活动更贴近模型在独立筹划、代码改动及指令行操作方面的内在能力的观测。官方代码库中的基准测试文档现阶段仅演示了jsonrpc-agent的极简形态运行方法,暂未披露DeepSeek Harness相比其他Harness方案的实际表现对照。
PTC策略引入了编程式工具调用(Programmatic Tool Calling)机制。操作流程为:模型先输出代码片段,然后由该代码片段负责组织与实施多次工具调用。对那些涉及循环查询、大规模操作或需根据中间产出进行决策分支的任务类型,该方式可缩减模型与工具之间的往复交互频率,也能够减轻上下文里堆积的临时数据量。然而,由于模型产生的代码获得了更广泛的任务编排权限,对运行隔离、超时管制、算力分配及访问权限等环节均施加了升级的难度需求。PTC方案的真实收益最终需通过任务完成度、经济成本及安全威胁等维度来判断。
创意模式具有最高的实验特征。Agent被赋予检视现时运行环境、在内存层面测试Cordis插件、进而组织新颖运行模式的能力。
官方的开发者手册中已涵盖了一份「自参照式」的Cordis实例,它准许Agent对现有运行的插件环境进行查看与改动。这给了Harness实施自适应优化的可能门路,不过要实现可靠的「自主演进」,仍须相当长的工程建设周期。
04
把每一次运行变成可回放的事件流
DeepSeek Harness的另一项核心创新之处在于采用了只进不退的会话记录机制。
会话环节系由依照时序递进的各项事件所组成,它是Agent整体交互过程的唯一权威记录。模型通信历史记录从此日志中推演而出,无需另行存储;重启与回溯操作亦均基于同一份事件集重新构造。
官方参考资料指出,系统级指令、思考过程、工具操作及其反馈、子Agent的调用安排与上下文推入等方面均被纳入记录范围,并允许在Trajectory界面中按类别进行查询;但完整呈现的推理内容深度终究受限于具体模型接口所返还的信息。此举的便利之处不言自明:假如Agent在第N步骤出现决策失误,开发人员可精准回到当时模型的实际输入信息,由此推判缺陷成因究竟出自模型的判定失误、工具回应的问题、系统指令的异动,抑或上下文注入的错误。OpenAI Agents SDK和LangGraph同样重视追踪、数据存储及重建机能作为Agent运行基础的关键环节,这表明可追踪性的角色已从测试辅助工具演变为Agent基础设施的必然组成部分。
单向日志机制同时引入了新的数据管理难题。完整的事件记录可能涵盖源代码、身份凭证信息、内部资料内容以及工具执行反馈。回溯能力固然提高了事件可审查程度,但这也扩张了需防护的数据范畴。
05
它与MCP处在不同层级
「一切皆插件」这一概念容易令人想起MCP。然则两者应对的技术议题实则不同。
MCP系为联通AI程序与外界数据、工具资源及业务过程的开放性规范,其中心工作是规范化连接路径。而Harness则负责更高层级的行为逻辑:选择何时向模型提供工具、是否在工具调用前需取得批准、执行结果的会话记录方式、失败时的重试策略、Agent何时需启动子级任务、以及何种条件下应停止运作。
从此可见,MCP服务端可充当DeepSeek Harness的工具供应来源,Skills能够演变成能力组件,Cordis插件则从事于将模型、工具、状态、循环、用户界面及策略等要素融合为可执行的Agent整体。即Agent「运作方式」的管制层。
该环节蕴含了显著的生态市场潜力。掌握Harness的一方愈加贴近真实业务操作点,更便于塑造对模型的取舍、工具的配置、成本的节制及研发流程的优化。不过,MIT开源许可仅能降低进入壁垒,并不能自动催生生态繁荣。关键取决于:开发者群体是否持续投入精力维护所创建的插件、企业是否肯将关键权限托管给来自第三方的组件、以及这些插件是否能在不同版本间保持稳定协作,这些因素共同决定该架构的成熟度与远景。
06
v0.1仍是一张设计蓝图
DeepSeek对产品的阶段定位有着相当明晰的说明:眼下处在供开发人员体验的预览期,之后将陆续推出可能不兼容的更新。截至文章发表时刻,代码库入口处的package.json将版本记为0.1.0-rc.5,GitHub的版本发布栏目仍为空白。更准确的定义方式是:它现阶段正在v0.1序列的发布候选与持续演进的过程中。
开发者在装配Node.js的条件下,能够借由指令npx @deepseek-ai/dsh web来拉起网页客户端,其缺省访问地址为http://127.0.0.1:3080;亦可直接从DeepSeek官方的源码库克隆并部署。官方所提供的开发手册眼下规定Node.js的版本需达到22.19或更高的22.x分支,要么使用24及以上的版本。
从配置与启动的工作来看,DeepSeek Harness的部署复杂度并不高,同时可借力WorkBuddy等具备终端与文件操作能力的Agent来协助完成Node.js的环境核查、安装及启动步骤。
值得提醒的一点在于:Harness框架本身以MIT协议形式免费发布,然而官方所推荐的使用路径依然需配置DeepSeek API证书;尽管用户可零成本启动Web客户端,但实际驱动Agent的执行需要为模型计算服务投入资金。
DeepSeek Harness将开源竞争领域的边界推向了模型之外。权重开源处理了「谁具备运行模型的资格」之类的问题,而Harness开源则更进一步触及了「谁拥有制定模型工作方式的权力」的本质。
伴随Agent从事跨越数小时乃至更长时间周期的操作任务,模型已演变为整体系统中的单个构成元素,运行框架层面的设计会日益决定系统能力的顶限与实用边界。
「一切皆插件」的理念为开发者打开了更为宽广的自定义改进空间,与此同时也意味着DeepSeek所承载的生态构建责任变得愈加复杂沉重。