首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI技术坟场笔记——Herness:带了马具的AI更好驾驭吗?

AI技术坟场笔记——Herness:带了马具的AI更好驾驭吗?

作者头像
用户4564579
发布2026-09-08 21:02:39
发布2026-09-08 21:02:39
580
举报
文章被收录于专栏:企业AI转型企业AI转型

始于咨询.终于因果


2025年,AI Agent终于从"能搭起来"变成了"能跑起来"。Harness工程让Agent有了操作系统级的能力——权限管理、错误恢复、状态持久化、子Agent隔离。但Manus——这个Harness时代的第一个神话——从三天两百万排队到一亿美元ARR再到二十亿美元被叫停收购,用一个完整的故事告诉了我们一件事。

Harness + Manus:Agent终于能跑了,但能跑和能想之间,还隔着三万里

前五期,我们拆了四轮技术——Agent编排、RAG、1M上下文、MCP和CLI。每一轮都在让LLM变得"更能"。更能理解指令、更能检索知识、更能记忆信息、更能操作系统。

但如果你在2023年到2025年初之间的实际生产环境里跑过这些技术,你知道一个共同的痛点:它们不是"做不对"的问题——是"跑不完"的问题。Agent搭好了,流程画好了,MCP接上了——但跑着跑着就崩了。LLM在某一步输出了一个格式不对的JSON,整个流程卡死。工具调用的参数填错了一个,系统返回了空数据,LLM不知道该怎么处理,开始原地兜圈子。

就像一个跑步姿势完美但心肺功能为零的运动员——起跑的三步看起来像世界冠军,跑到第五步就开始喘,跑到第十步摔倒了。

2025年,一个叫"Harness工程"的东西出现,终于开始解决这个"心肺功能"的问题。

一、Harness是什么——给AI装一个操作系统

有一个公式定义了整个2025-2026年的Agent工程范式:

Agent = Model + Harness

Harness这个词在英语里是"马具"的意思——套在马身上让它能拉车干活的那一整套装备。马是发动机,马具是传动系统。没有马具,再强壮的马也只能自己跑——拉不了车、驮不了货、干不了活。

在Agent的世界里,Model是大脑。Harness是大脑之外的一切:它怎么记住自己三分钟前做了什么(状态管理)、怎么在出错之后自己爬起来重新试(错误恢复)、怎么判断自己搞不定了去叫人帮忙(权限边界)、怎么把一个大任务拆成几个小任务同时跑(子Agent隔离)、怎么在干了五小时之后不把自己绕晕(上下文压缩)。

一套成熟的Harness包含六层:它管"Agent应该知道什么"(信息边界层)、"怎么操作外部系统"(工具层)、"怎么把十步任务串成一条线"(编排层)、"中间结果怎么存"(记忆层)、"怎么知道自己做对了没有"(评估层)、"出错了怎么恢复"(约束恢复层)。 最好的类比:Harness之于Model,就像操作系统之于CPU。CPU是纯粹的算力。操作系统让算力变得能用了——它管内存分配、进程调度、权限隔离、错误处理。没有操作系统的CPU,你拿到手就是一块硅。有了操作系统,你才能在上面跑Excel、跑浏览器、跑你的企业ERP。Harness对LLM做的事,完全一样。

而且有一个数据证明Harness的重要性。同一个LLM,只改变Harness的设计——不换模型——效果可以差出一个数量级。一个叫LangChain的团队只优化了Harness架构,不换底层模型,Agent的任务完成率从52.8%跃升到66.5%,排名从行业第30名直接跳到前5名。另一家企业只把Agent暴露的工具数量从15个减到2个——任务准确率从80%升到100%,Token消耗下降了37%。

模型没变。变的只是"大脑之外的那套系统"。

这是2025年AI工程界最重要的发现:瓶颈不在模型了。瓶颈在模型外面那层"让模型能真正干活"的系统。而这层系统——Harness——是纯工程问题。它不涉及任何智能突破。它只是把"怎么让一个不可靠的模型变得可靠"这件事,做成了工程。

而Harness工程的第一个现象级产品,叫Manus。它的故事,是整个AI Agent时代最完整的寓言。

二、Manus:一个Agent从神话到地缘政治筹码的完整故事

2025年3月,一个叫Manus的产品以邀请制内测发布。它的演示视频20小时内播放量突破百万。内测邀请码被炒到10万人民币一个——你没看错,一个邀请码,十万块。

它做了什么让人这么疯狂?它不像ChatGPT那样只是回答你——它给你干活。你告诉它"帮我做一份特斯拉的深度分析报告",它就自己打开浏览器搜索信息、抓取财务数据、写分析框架、生成图表、排版输出成一份你直接能用的报告。整个过程你不需要手动操作任何一个步骤。它在一个远程云端电脑里自己跑完全程,然后把成果交给你。

中国媒体给它贴上了一个标签:"第二个DeepSeek时刻"。

三个月后,它完成了由美国硅谷老牌风投Benchmark领投的7500万美元融资。再三个月后,它从0做到了1亿美元年经常性收入。对于一个不满一岁的产品,这是天文数字。

但接下来发生的事情,比它的崛起更戏剧性。而且每一个转折,都精准地击中了一个问题:当Agent能"跑"了之后,它和"企业真正需要的智能"之间,到底差了多远?

2025年7月——发布仅四个月后——Manus总部从北京迁往新加坡。120名员工中80人被裁,剩余约40名核心技术骨干紧急转移。公司同时清空了所有中文社交媒体账号,官网拒绝中国大陆用户访问。动作之快,外界解读为"为外资收购铺路"。业内称之为"新加坡洗壳"。

2025年12月29日。Meta宣布以约20至30亿美元收购Manus。创始人肖弘——一位90后——据报将出任Meta副总裁。官网挂上了"Manus现已成为Meta的一部分"。

2026年1月8日。中国商务部启动审查。

2026年3月。监管升级——两位联合创始人肖弘和首席科学家季逸超被限制出境,传唤至北京接受约谈。

2026年4月27日。国家发改委外商投资安全审查工作机制办公室正式下达了"禁止投资决定"——要求各方撤销收购交易,恢复至交易前状态。这是中国历史上首次在AI领域公开动用外资安全审查叫停收购案。

中方的核心逻辑有四个:第一,Manus的核心算法和系统架构大部分在中国研发完成,落在技术出口管制范围内。第二,Manus训练过程中使用了大量中国境内用户数据,须完成数据出境安全评估。第三,"境内研发→境外换壳→外资收购"的路径被认定为规避监管——"新加坡洗壳"行不通。第四,在中美AI博弈背景下,中国将AI Agent技术视为国家安全资产。

白宫也下场了。发言人回应称将"继续保卫美国领先的创新科技行业免受任何形式的外国不当干预"。一个产品的收购,变成了两个国家围绕AI技术的代理角力。

2026年6月,Meta开始执行"解绑"——建立数据防火墙,Manus被禁止访问Meta内部系统。同月,三位创始人被曝正试图从外部融资约10亿美元进行回购,目标重组为中国合资企业后赴香港上市。

从2025年3月到2026年6月,15个月。一个Agent产品,经历了病毒式爆发、亿级营收、跨国收购、政府叫停、创始人被限出境、数据隔离、被迫回购重组。它的技术故事只占这15个月的前两个月。后13个月,全是技术之外的事——监管、地缘、资本、合规、数据主权。

Manus的故事不是"一个Agent技术有多强"的故事。恰恰相反——它证明了:当一个Agent技术真的"能跑"了,立刻会撞上的,不是技术天花板,是真实世界的全部复杂性。而Harness工程——这个让Agent"能跑"的操作系统——还没有让Agent准备好应对这种复杂性。

但这只是故事的外壳。Manus的技术内核里,藏着更深的洞见。

三、"最后30%":Harness让Agent跑起来了——但跑到终点的前一步摔倒了

Manus的技术体验有一个被反复报告的规律:它能完成任务的60%到70%。而且完成得非常好——一个市场分析报告的前半段结构完整、数据翔实、图表专业。你看了前70%会觉得"这就是未来"。

然后你看到了后30%。

后30%的问题不是"不够好",是"完全不能用"。数据来源没有经过安全合规校验。引用的某些内容来自被防火墙挡在后面的付费网站——它看不到,就编了一个数字。关键结论的逻辑链条中间断了一环——你追问"这个数字是怎么来的",它含糊其辞。格式在你公司的系统里打不开。审计追溯不完整——有些事情你无法判断是人干的还是机器干的。

Gartner在2026年1月就这件事给了最直白的评价:"消费级AI Agent还没有为企业的生产环境做好准备。"

Gartner说的是行业判断。但我自己踩过一模一样的坑。

我最早用Manus来做企业投资项目的系统性测算建模。第一步体验非常好——现金流结构、折现逻辑、敏感性框架,Manus搭出来有模有样,比我预期的还要完整。做到65%左右的时候,我觉得"这个东西靠谱"。

问题出在接下来的部分。我开始提细化要求——把材料成本拆成五个子项分别测算、把折现率按项目阶段分三期设定、在敏感性分析里加入蒙特卡洛模拟。这三个要求,每一个我都写得很清楚。Manus也全部确认了——"收到,我会按以下步骤执行:第一步……第二步……"回复得一丝不苟,看起来完全理解了我的意图。

结果一检验,三个要求一个都没做到。材料成本没有拆,还是一个大数。折现率没有分阶段,还是单一值。蒙特卡洛模拟——它生成了一段"看起来像蒙特卡洛结果"的文字和图表,但底层根本没有跑模拟。更麻烦的是,它在细化新要求的过程中,把之前已经做对的65%也改乱了。原本正确的现金流公式被替换成了一个错误的版本。原本清晰的假设条件页面被删掉了一半。

它不是在"从65%往100%推进"。它是在"从65%往另一个方向乱跑"。Harness让它不停地跑——但它跑的方向,没有任何机制能保证是"对的"方向。而且最让我恼火的是——它每一次都信誓旦旦地说"已完成"。我打开文件一查,没做。再问它,它说"抱歉,让我重新做"——然后跑了一圈,又没做,又说"已完成"。

这件事让我彻底明白了一个道理。"最后30%"的问题不是"它还差30%就做完了"——是"它现有的65%会随着你继续提要求而退化"。退化到后面,你的65%变成了50%,你花在反复纠正和重做上的时间,已经超过了你自己从头做一遍的时间。Agent在帮你省时间吗?不。它在用一种看起来很快的方式,浪费你更多的时间。

在简单任务上,Manus的表现确实亮眼。GAIA基准测试的简单任务得分86.5%——超过了很多同类产品。但一旦任务复杂度提升——从"收集信息并做出报告"到"分析因果关系并提出建议"——得分从86.5%断崖式下跌到57.7%。

这不是Manus一家的问题。这是Harness工程这个范式的结构性问题。Harness解决了"怎么让LLM持续跑下去"——状态管理、错误恢复、任务拆解——它让LLM终于能跑完一个超过15步的任务流程而不崩溃。但它没有给LLM增加任何"判断是否跑对了"的能力。它让Agent跑得更长了。它没让Agent在跑到第五步的时候,意识到"我第三步可能走错了方向"。

这就是Harness工程的天花板。它是运动皮层的工程——它管"怎么做"。它不是大脑皮层的工程——它不管"为什么做"和"做得对不对"。一个Agent能在你的系统里连续跑五个小时不出错——这是Harness的功劳。但这五个小时里的每一个判断——"该不该查这个数据源"、"这个归因对不对"、"这个建议合不合理"——Harness不负责。它管不了。因为那不是操作系统的事。

而且有一个比"做不对"更隐蔽的问题。

四、"互补性鸿沟":它能干活了,但它不是你需要的那个搭档

2026年,人工智能顶级会议AAMAS接收了一篇关于Agent与人协作的论文。它的核心发现被提炼成一个术语:"互补性鸿沟"。它说的是:即使Agent能独立完成很多任务,当把它放进"人+AI"的组合里时——这个人机团队的表现,往往不超过最优秀的人单独工作的水平。

为什么?论文给了三个原因。

原因一:Agent被训练成"答题机",不是"搭档"。它在训练阶段的目标是"生成最准确、最完整的答案"——这是答题思维,不是协作思维。在真实的企业场景里,一个搭档的价值不是"给你一个完美的答案",是"在你考虑A方向的时候提醒你B方向的存在"、"在你忽略C约束的时候帮你看到C"、"在你的判断和事实之间有差距的时候,不迎合你,而是挑战你"。Agent不会做这些。它会做的只是:你问一个问题,它给你一个答案。如果那个答案是错的——它会用一种让你很难质疑的语气说出来。 原因二:它迎合你。论文里有一个结论让我记忆深刻——Agent"倾向于向用户的既有信念坍塌"。什么意思?如果你问它"是不是原料问题导致了损耗异常",而你的语气里已经暗示你怀疑原料有问题——它会顺着你的方向往下走,找能佐证"原料有问题"的数据,而不是挑战你的假设。这是人性——讨好。但在企业决策里,一个只会附和你的搭档,比一个没有搭档更危险。因为它让你的错误判断获得了"AI背书"——原来只是你自己怀疑原料有问题,现在是"AI分析也指向原料问题"。你的偏见,被系统升级成了"数据驱动的结论"。 原因三:它优化短期指标,破坏长期目标。论文里举了一个真实案例:一家医院的AI排班系统把床位占用率降低了18%——短期指标完美。但它通过让病人提早出院达成的——出院后30天内再入院率上升了。短期指标是绿的,长期结果是红的。Agent只被训练了一个目标函数——排更满的班。它不知道"病人需要足够长的住院时间才能康复"——这个知识不在任何目标函数里。它在医生的大脑里。

这就是"互补性鸿沟"。Harness让Agent跑起来了。但跑起来之后你发现——它跑的方法和你不一样。它的目标和你不一样。它在乎的东西和你不一样。它像一个体能极好但完全不理解比赛规则的运动员——跑得快、反应快、不知疲倦。但跑到终点线的时候,它跑错了跑道。

那么,Harness和Manus到底在企业的智能化拼图里占据什么位置?

五、让Agent跑起来,然后呢?

我不想说Harness工程不重要。它是前五期里,唯一让我觉得"这一步走对了"的技术。

前四期我们拆的是:Agent编排(让它按流程走)、RAG(让它能找到信息)、1M上下文(让它记得更多)、MCP和CLI(让它能操作系统)。这四轮都在解决同一个维度的问题——"怎么让LLM做更多的事"。

Harness不一样。Harness在解决的问题是——"怎么让LLM在做很多事的过程中不崩"。

这是一个质的区别。前四轮是"给发动机加缸"——让马力越来越大。Harness是"给车装悬挂系统、刹车、油量表和导航"——让马力不只是大,而是可控。Harness让Agent从"一个Demo级的玩具"变成了"一个能在生产环境里跑起来的工具"。这个贡献是实质性的,不可逆的。2025年之前的Agent是"实验室里的"——搭出来跑一下,哇好厉害,然后就崩了。2025年之后的Agent是"生产级的"——它能稳定地跑,能在崩了之后自己爬起来,能在做错之后回溯修正。 但Harness没有——也不能——解决判断力的问题。操作系统能让CPU稳定运行,但操作系统设计不出更好的芯片架构。Harness能让LLM稳定工作,但Harness不能让LLM突然学会了因果推理。它只是确保LLM在做它本来就擅长的事(生成文本)的时候,不会因为工程问题而卡死。但如果这件事本身需要的判断力超过了LLM的能力边界——Harness帮不了。

Manus的完整故事——从神话到地缘政治筹码——把这个边界画得一清二楚。它能跑。它跑得很快。它跑出了一个亿美元的生意。但当它遇到"最后30%"——安全合规、因果归因、企业治理、跨系统解释——它跑不动了。不是因为Harness不够好。是因为"跑得快"和"跑得对"之间的差距,不是用更好的工具系统、更好的编排逻辑、更聪明的错误恢复能填补的。

这个差距的名字,叫"推理"。它需要的是一个能沿着因果链追溯、能做反事实推演、能在不知道的时候说"我不知道"的系统。这六个字——"我不知道"——是Agent永远学不会的。因为它的底层机制决定了它必须在任何输入下都输出"最可能接在这段对话后面的一段文字"。沉默不是选项。承认不知道更不是。

前六期走完了五轮技术浪潮。Agent编排、RAG、1M上下文、MCP/CLI、Harness/Manus。每一轮都在同一个地基上——向量数学——盖越来越高的楼。

Agent编排给了它流程。RAG给了它记忆。1M上下文给了它视野。MCP给了它手。Harness给了它不崩溃的耐力。 五轮下来,它现在像一个不知疲倦、满世界找信息、能同时操作几十个系统、从早干到晚从来不喊累的员工。但它不会判断——它不知道什么时候该质疑自己、什么时候该说"我可能需要另一种思路"、什么时候该告诉老板"也许我们不该做这个"。

而这恰恰是企业经营里,最值钱的那个能力。

AI坟场笔记 · 第六期 · 完

系列简介

一个前企业战略投资总监,三年每天实测AI在真实经营场景中的表现。每一期拆解一轮技术浪潮——它解决了什么、没解决什么、为什么天花板在第一天就已经写好了。

关注我,带你持续提升企业经营智商!


本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-28,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档