本文作者: 高允毅

2026-08-13 18:16

导语:当下刚需的基建方向,全被 DeepSeek Harness 锁定

当下刚需的基建方向,全被 DeepSeek Harness 锁定

作者丨高允毅

编辑丨岑 峰

昨晚,DeepSeek V4 Pro 正式发布,性能全面逼近 Fable 5 ,价格却只有1/57 ,再次坐实了 “智价比之王” 的美誉。

如果细看官方公布的十项基准测试的话,那些亮眼的数据,其实都表明DeepSeek想全面迈向“工业级 Agent 生产线”,比如它补齐了软件开发和工程能力短板,在终端报错、工具调用、长程任务都有不错表现。

另一方面,当模型的智力水平已经无限拔高,即将推出的 DeepSeek Harness,正是它补齐 Agent 落地能力的关键后手。

而今天网上爆出一份DeepSeek Harness内测入选项目局部名单,进一步将DeepSeek的发力方向勾勒清晰。

DeepSeek 的筛选标准很有特色:不看名气,70% 的入选项目是几乎零热度的个人或小团队新作,大热的“高星”项目反而落选。

因为很多高星项目做的是通用工具,未必为原生Harness设计。而不少小众项目,本身在做Codex、Claude Code、Pi插件,可以顺势适配DeepSeek Harness。

更重要的是,DeepSeek似乎更关注这些项目能否填补上它的生态空白,比如特殊的UI、创新编排模式。要有实际的功能,不能是空架子。

在种种条件下,这些入选项目集中体现在一些赛道上:

首先,整个项目的生态要围绕Harness核心能力展开,这主要体现在MCP插件与 Coding Agent项目占比最高,能解决工具调用与代码落地的核心痛点。

其次,项目还集中在 Agent Runtime(运行时)、编排框架、可视化 UI 与多智能体调度 等Agent适配层,直接影响环境跑起来安不安全、长任务容易跑偏、黑盒执行看不见、多模型如何协作等具体问题。

相较而言,医疗、法律、金融等垂直应用项目占比不足 4%。

01

都有哪些入选项目?

这个局部名单中,已经列出了17个开源项目,我们选取了其中的4个项目,看看都是什么类型的Harness工具。

▎安全操作系统openma-ai(224颗星)

open-managed-agents(简称 OMA)是一套典型的“安全操作系统”。虽然只有224颗星,但它能解决 Agent 落地时最头疼的问题,即代码跑起来之后,怎么保证安全可控。

传统的 Agent 框架大多只负责 “让模型怎么想”,管不了 “代码跑起来安不安全”。OMA利用对Claude Managed Agents 的开源复刻,正好补上了这一块。

首先,它可以通过在网络网关层自动注入凭证,实现了密钥与执行沙箱的全程隔离。这样AI干活的时候不知道密码,就不会被Prompt 注入攻击。同时,OMA 把每步操作都以事件日志形式持久化保存,相当于给任务做了“自动存档”,这样就不怕进程意外中断。它还自带沙箱和企业工具包,在GitHub、Slack 这些协作平台可以开箱即用,让Agent真正变成企业的“数字员工”。

面对如今各种顶尖的大模型大脑,OMA 的作用正是为Agent落地“保驾护航”。

从技术定位上看,OMA 瞄准的是 Agent 执行层,负责管理沙箱生命周期、分发 MCP 工具、维护 WebSocket 会话广播,属于典型的执行层基础设施。

https://github.com/openma-ai/open-managed-agents

▎智能路由role-model(97颗星)

role-model 走的是“智能路由”的技术路线。虽然是不到百星的小项目,但它可以让Agent的成本可控。它最擅长的是精准判断任务难度,把活派给最合适的模型。

对于DeepSeek-R1而言,无论任务多简单它都倾向于“长思考”。当 Agent 执行自动化流水线时,如果只是让模型去看一眼当前目录的文件列表、或者跑个简单的正则替换,每一步都要烧掉几百个 Token 的推理成本,这显然极不划算。

role-model可以将任务按难度进行动态拆解。把简单活儿路由给毫秒级响应、极低成本的本地轻量小模型;把架构重构、找出复杂Bug的活儿再派给R1,直接解决成本难题。

它还有“决策可解释性”,它将每一次路由决策都固化为 Requests(请求)、Profiles(画像)、Policy(策略)、Artifacts(产物)四个标准化构件,工程师可以随时调阅“为什么这一步派给了模型 A 而不是模型 B”。

除此之外,它原生支持多厂商灾备,一旦主通道遇到限流、延迟抖动,能无缝切换到备用节点,保证整条 Agent 流水线不中断。

可以说,省钱和可控性都是Agent落地时的关键细节。它归属于 Agent 适配层的流量编排与调度层面。

https://github.com/try-works/role-model

▎端侧版龙虾 MateBot:(46颗星)

MateBot是一个更偏向端侧的效率工具,解决的是“人如何 24 小时随时随地管理 Agent”的痛点。

眼下主流的编程 Agent 大多被绑在本地终端上,而很多长任务的工作需要开发者随时查看AI的进度,及时干预。MateBot 的作用类似于 OpenClaw,它让开发者通过手机端就能直接给本地 Agent 派活、实时查看执行日志,遇到卡点或死循环时随时可以介入中断或修正。

除了远程控制,它还有自己的“端侧记忆三件套”,有自动记忆、外部记忆、失败记忆三套系统。它还有本地“错题本”,可以把Agent犯的错误记录在知识库,下次直接避开。

对于要走向真实生产环境的 Harness 来说,MateBot 补齐了长周期任务中的人机协同闭环,也解决了模型跨会话反复踩坑的问题,属于补齐执行层工程能力。

https://github.com/aresbit/MateBot

▎多AI协作平台ccteam(141颗星)

很多开发者手里同时握着好几个编程 Agent,如何让这些Agent好好为自己干活,是当下工程化落地的一个关键问题。

不少Agent之间缺少良好互通,人成了来回同步上下文的 “传话筒”。ccteam 相当于给这些 Agent 搭了统一指挥台,让强推理模型当项目经理拆分任务,给各模型分配好的角色,并行推进任务。

在多Agent协作中,ccteam可以让任何一个Agent会话都能用自然语言指挥其他Agent干活,比如“让Codex实现这个接口并跑测试,让Grok分析性能热点,最后让Claude Code交叉Review”。

与此同时,开发者在 Telegram 或飞书上直接发消息就能调度所有 Agent,不用专门打开某个系统。ccteam 还组成一个集群,无论项目在哪台机器上跑,都能统一查看和管控。

它还会控制预算,钱花完了自动停工,避免 Agent 失控烧钱。

能管AI协作、控制进度和预算,这属于Agent 适配层的多智能体编排调度层。

https://github.com/firstintent/ccteam

02

DeepSeek Harness

究竟在下一盘什么大棋?

在上述项目之外,如果将高频出现的5个方向(多模型路由、桌面 Agent、Coding Agent、框架或 SDK、以及 UI或客户端项目,这些都是的基础设施层的热门方向)拼凑起来,DeepSeek的战略意图已经呼之欲出:它正开始从“最强API”向“工业级Agent生产线”转换。

为什么大模型刚进入深水区,DeepSeek就急着做基础设施?因为 DeepSeek 的“大脑”已经足够强了。

昨晚发布的V4 Pro 的代码能力直接挤进全球第一梯队,R1 的长思考深度更是断崖式领先。配合 Context Caching(上下文缓存)带来的极致 Token 成本,理论上,Agent 已经具备了“又快又便宜”的落地前提。

但“想得快”和“跑得稳”是另外一回事。仔细剖析这些网传的DeepSeek Harness重点扶持项目,可以发现DeepSeek正在急切地补齐这几个短板:

▎补齐执行层安全

R1擅长写代码,但不提供运行环境。直接在企业真实的Terminal上跑,一个幻觉引起的rm -fr删库跑路幻觉代码,就能把系统搞瘫痪。DeepSeek Harness扶持OMA 这类带凭证隔离、沙箱机制和审计日志的底层项目,就是要给这些可能造成破坏的“数字野马”套上缰绳,让企业可以安心交出业务控制权。

▎补齐工程可靠性

真正的软件工程任务,动辄需要Agent循环纠错几个小时,在这期间,网络稍微抖一下、大模型 API 超个时,如果没有持久化存档,整个任务就得从头来。

很多人会有一个严重的技术误区,觉得最新的 DeepSeek V4 Pro 已经具备了 1M 的超长输入窗口 和 384K 的超长输出能力,信息量这么大,是不是就不用管上下文管理了?

恰恰相反,超长输出解决的是“一口气能写多少字”的空间问题,而持久化解决的是“写到一半断了,能否重启接着写”的时间问题。DeepSeek Harness 吸收 MateBot 这类具备“自动存档”、“失败记忆”和“错题本”功能的组件,就是要确保 V4 Pro 在一次性吐出 384K 宏大内容的漫长过程中,拥有中途夭折后随时续传的工程可靠性。

▎补齐商业化ROI

AI越用越多,解决的问题越来越复杂,谁来控制成本?如果事事都去触发 R1 的长思考(哪怕 DeepSeek 已经把价格打骨折),或者在多 Agent 协同中产生无效的“来回闲聊”,企业的 Token 账单依然会原地爆炸。

DeepSeek引入role-model(按难度智能路由)和 ccteam(多智能体进度与预算控制),正是希望更好分配AI算力,把简单的搬砖工作丢给本地小模型,把架构级的问题精准派发给R1,这是能让Agent满足企业成本需求、大规模落地的唯一途径。

总结而言:过去,DeepSeek 靠 V4 Pro 和 R1 证明了自己是顶级的“发动机制造商”;而现在,通过这批不起眼的“配件”,才真正打造了一套完整的“汽车底盘”。让Agent安全、可控、用得起,这些正是DeepSeek Harness要补的课题。

参考链接:https://x.com/NFT_Chen/status/2087500877238337930

上车,雷峰网(公众号:雷峰网)带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知。

收入远高本土平均水平!三星、SK海力士员工跻身韩国 ...

支付宝参与可信政务智能体服务平台,携手信通院等机 ...

WAIC 观察:通用具身智能要在有生之年实现,急需「物 ...

安全预警系统,看不见的滴滴「基建」

编辑

OpenAI 一夜重置全员额度,800 万开发者集体「续命」

Claude Opus 5 被曝今晚发布,Fable 5 的水平,腰斩的价格

谁在训练 Kimi K3 ? 深挖贡献者名单,这有一份最全档案

AI 才是不知疲倦的入侵狂魔,看来以后黑客也要失业了

数学大佬在前面拓荒,AI研究员在后面捡宝,菲尔兹奖还能拿来破AI「黑盒」?

当流量税被 API 拿走,字节和谷歌的护城河还剩什么?

「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解

赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?

Jeff Dean 创业路演 PPT,惊现 34 位创始人,谷歌系人才占领半壁江山

AI 才是不知疲倦的入侵狂魔,看来以后黑客也要失业了

20万星里程碑达成!GitHub 封神技能包,专治 AI 瞎写、失忆、造屎山