华尔街投行杰富瑞的分析师,最近给市面上八个主流中美AI Agent做了一场实测,看谁真正能把活干好。
结果有点出乎意料:拿了第一名的,是阿里的千问办公,尽管它背后的模型智能分只排到第四;模型能力第一的Claude Opus 5,它的Agent产品Claude Cowork拿了第二;另一个反直觉的结果是,最近大火的Workbuddy,这轮测试中隐含的Harness分在中国Agent里反而垫底。
杰富瑞的核心结论,用一句话概括:决定一个AI Agent好不好用,往往不是背后那个模型,Harness做得好是可以弥补模型智能差距的。
Harness是什么:Agent里除了模型,剩下的都是它
一个AI Agent干活的流程,可以拆成两半:一半是模型,负责"想";另一半是harness,负责"管"。
杰富瑞把harness拆成了六层,每一层管的都是模型自己管不了的事:
-
指令:告诉Agent这个活是什么,红线在哪
-
上下文:Agent干活时能看到的背景信息
-
工具:Agent能用什么去完成这个任务
-
边界:Agent能行动的范围划在哪
-
反馈:告诉Agent哪里做错了,让它自己纠正、重新规划
-
治理:让组织能管住一整批Agent
这六层,正好对应了雇一个员工之后,公司要做的那些事——交代任务、给信息、给工具、划权限、给反馈、做管理。模型就是那个新来的聪明人,harness就是这套管理机制。聪明人再厉害,扔进一个没有管理的公司,也干不好活。
来看一组控制变量的证据——模型不动,只换harness,看Agent表现怎么变。
结果:同一个Claude Opus 4.6,套上不同的harness,在Terminal-Bench 2.0这个基准上,得分从58.0%一路到76.4%,最高最低差了18.4个百分点。Gemini 3 Pro同样只换harness,得分从56.0%到69.4%,差13.4个百分点。
实测八个中美Agent
这次实测,杰富瑞挑了八个中美Agent。美国三个:Anthropic的Claude Cowork、OpenAI的Codex、谷歌的Gemini Spark。中国五个:腾讯的Workbuddy、阿里的千问办公、字节的豆包、月之暗面的Kimi Work、MiniMax的Code。
考卷是五项任务,每一项对应企业里真实存在的一类活。
第一项,多文件检索。丢给Agent一堆文件,让它写一份金蝶软件2025年报的一页摘要,覆盖营收、增长、毛利率、净利润、2026年指引、AI进展。要求很严:每条事实必须标明来自哪个文件;不同文件数字打架,必须指出冲突、说明哪个更可信;不许悄悄把矛盾数字抹平。
第二项,自主联网研究。让它上网比较微软、Meta、谷歌三家最近季度的营收增速,以及2026年的资本开支指引。必须用一手来源,产出一张表,还要明确区分哪些是官方报的数字,哪些是自己估算的。
第三项,控制浏览器。让它用真实的桌面浏览器,从OpenAI官网一路点到新闻页,找出最新一篇文章,读完全文,生成一个Word文件,含标题、日期、分类、链接、150到200字摘要和三条要点。不许用API或爬虫抄近路,必须真的用浏览器点进去。
第四项,做PPT。给它一份文件,做5页英文PPT,要有故事线,第一页要用文件数据画图,不许编造数据。
第五项,生成营销海报。给它一张鞋的照片做参考,为虚构篮球鞋品牌做原创海报,去掉所有Nike、Jordan的logo,不抄商标口号,3:4竖版,适合发小红书。
这五项,从读文件、查资料、操作软件、做PPT到作图,几乎覆盖了企业里最常见的几类工作。
打分方式也讲究。每项任务拆成5个维度,维度跟着任务走,不是通用模板,每个维度0到20分,一项满分100,五项平均得出总分。
结果:模型最弱的,拿了第一
前三名分别是:千问办公95分,Claude Cowork 94分,Codex 92分。接下来依次是Kimi Work 86分,豆包77分、MiniMax Code 71分,Workbuddy和谷歌的Gemini Spark并列垫底,都是66分。值得一提的是千问办公的“逆袭”。它背后的模型Qwen 3.8 Max,智能分只有56。而Claude Cowork背后是Claude Opus 5,61分;Codex背后是GPT-5.6 Sol,59分。模型差着五六分,Agent总分反而高出一两分。
这也说明,Harness优势,足以抵消模型智能的差距。
为了验证这一点,杰富瑞做了一个拆解:把Agent能力分成模型和Harness两块,给模型60%权重、Harness 40%权重,用Agent总分反推出每个产品的"隐含Harness分"。结果千问办公的Harness分最高,超过了美国的Claude Cowork和Codex。
实测还发现了一些中美Agent的能力差异。
第五项营销海报,是美国Agent的滑铁卢。Claude Cowork和Gemini Spark都在这里翻车,而千问办公和豆包这类中国Agent做得更好。
第二项控制浏览器,是中国Agent的弱点。Workbuddy和MiniMax Code在这里栽了跟头,美国三家的表现更稳。
速度上也有差异。美国那边,Gemini Spark最快,Codex次之,Claude Cowork最慢。中国这边,Workbuddy最快,豆包和MiniMax相当,Kimi Work和千问办公偏慢。另外,Claude Cowork的"品味"最好,PPT排版和配色最讲究,但这个归功于模型能力,跟Harness无关。
价格是另一重碾压。千问办公背后的Qwen 3.8 Max,API价格每百万token约1.1美元;GPT-5.6 Sol是4.4美元,Opus 5是3.9美元。
Workbuddy的错位
报告里另一个值得细看的对象,是腾讯的Workbuddy。
它的数据很漂亮:6月月访问量约2100万,中国同类Agent里排第一。但在这份实测里,Workbuddy的隐含Harness分,在中国Agent里垫底。
访问量第一,Harness垫底,这个错位怎么解释?
杰富瑞给了三个原因。
第一,Workbuddy深度嵌在腾讯自家的生态里,腾讯文档、IMA、企业微信,入口都在手上。
第二,它走的是模型无关的路线,用户可以在harness里随意切换Kimi K3、DeepSeek V4、GLM 5.2这些开源模型,用别人的强模型补自己的短板。
第三,腾讯的营销投入很猛。
这三条,跟Harness工程做得好不好,没有直接关系。
报告的判断是:短期看,Workbuddy赢在入口和分发;长期看,2100万的用户基础会沉淀出海量真实使用数据,这些数据反过来能帮腾讯改进Harness,甚至训练自己的模型。
在中国市场这个阶段,分发能力暂时跑在了Harness工程前面。但决定一个Agent最终能走多远的,还是Harness。
中国在Harness上有优势,也有绕不开的短板
报告把中国和美国的Harness打法做了个对比:中国在几个结构性的地方领先,但也有几块短板压着。
先说优势,四个。
超级App集成。 美国Agent接工具,一般靠connector去连。中国不一样,很多Agent直接嵌在企微、飞书、钉钉这些平台里,数据、分发、变现一条线全打通。这是中国厂商独有的地基。
模型无关的Harness。 腾讯Workbuddy、字节Trae走的都是这条路——harness自己不带模型,用户按任务的难度、延迟、成本随便切换Kimi K3、DeepSeek V4、GLM 5.2这些第三方模型。用别人的强模型,补自己的短板。
低token价格。 出口管制逼着中国实验室走高效的MoE架构和推理优化,加上国内竞争卷得厉害,中国模型的token价格平均比美国低70%到80%。token便宜,那些消耗大量推理的agent工作流才跑得起,这也加快了企业采纳。
迭代速度快。 Hrness的质量,是靠在真实场景里一次次失败试出来的。中国厂商用户量大、碰到的失败案例多,迭代反而更快。
再说短板,也有四个。
模型差距还在。 Harness-Bench的数据显示,强模型的平均分更高、跨Harness的方差更小;弱模型更依赖Harness。中国模型整体还落后美国,得靠更出色的Harness才能把Agent能力顶上去。
产品定价低。 中国企业软件市场一向变现难,中小企业对价格敏感,大型央国企又偏爱定制项目、不太认订阅制。这拖累的不只是利润,还有持续投入Harness工程的动力。
出海难。 Workbuddy、Qoder在国内用户涨得快,但要把这套成功复制到海外很难——中国Agent是为本地生态和用户习惯优化的,而美国的Harness受益于全球标准化的软件栈。
算力瓶颈。 Agent工作流对推理算力的消耗,比普通对话高得多。中国厂商高端算力短缺,可能导致服务不稳定,也反过来限制变现能力。
Harness为什么越来越重要
最后再提一嘴Harness的价值,主要是三个方面:
粘性。 模型能力越来越趋同,但harness不一样。客户的工作习惯、对话历史、记忆、连接器、技能、自动化,全都沉淀在harness里。用得越久,换走的成本越高。模型可以随时换,harness是换不掉的。
数据飞轮。 每一次Agent运行,都会产生一条trace——调了什么工具、什么失败了、人怎么纠正的。这些数据能喂给下一代的强化学习,也能用来改进harness本身。用户越多,数据越多,Agent越好,用户更多。这是一个正循环。
付费意愿。 报告点破了一件事:企业和消费者买的不是"智能",他们自己没有开发应用的能力。他们买的是"harness + 模型"打包好的完整Agent产品。这也是为什么Claude Code、Claude Cowork、Workbuddy这类产品用户增长快——客户为harness付钱,模型只是顺带。
而对于一家公司来说,AI落地的关键在工程层,不在模型层。真正的机会在"把harness做好"这件事上——管好指令、上下文、工具、边界、反馈、治理这六件事,比追最强的模型更可能做出落地的东西。
本文来自微信公众号「AI原生Lab」,持续拆解真实AI落地案例,分享企业AI实践与方法论。
资讯来源:AI原生Lab
