最强未必最优:企业部署AI智能体的“能力陷阱”

高德纳预测,到2027年,超过40%的AI智能体项目将被终止,主要原因包括商业价值不明确、成本持续上升以及风险控制措施不足。 Image: Daniil Komov/Unsplash
- 预计到2027年,超过40%的AI智能体项目将被终止,价值不明确和成本持续上升是其中的重要原因。
- 在针对企业供应商发票处理系统开展的受控测试中,能力最强、成本最高的配置反而表现最差。
- 相较于采购能力等级最高的模型,更重要的是根据具体任务匹配模型,并对各组件进行组合测试,而不是逐个单独测试。
AI智能体(Agentic AI)——能够自主规划并采取行动,而无须在每个步骤都等待指令的软件,是2026年企业技术领域最受关注的议题,也可能成为2027年最让人失望的代价。
高德纳(Gartner)预测,到2027年,超过40%的AI智能体项目将被取消,主要原因包括商业价值不明确、成本持续上升以及风险控制措施不足。目前,各类组织都在决定首次大规模、实质性部署AI智能体的重点领域。然而,真正依据证据作出选择的组织寥寥无几,因为公开可获得的证据十分有限。供应商的宣传主张比比皆是,受控条件下的比较研究却极为少见。
为弥补这一证据缺口,我与麻省理工学院的一位合作者牵头开展了一项研究。我们与一家全球性企业合作;该企业每年处理的供应商发票金额超过750亿美元。我们构建了一套AI智能体系统,使其能够自主调查并解决发票错误,并在无法解决问题时将其升级移交人工处理。随后,我们使用四种模型配置对同一组44张测试发票进行测试,分别衡量其准确率、计算资源消耗和处理耗时。
研究结果与当前大多数部署决策所依据的假设相悖,即优先采用现有能力最强的模型,才是稳妥的选择。我们可以将这种思维称为“能力陷阱”。
“能力陷阱”并非假想风险
高端配置将当时能力最强的推理模型与高端文档读取模型搭配使用,但最终排名垫底。该配置在无须人工介入的情况下解决了91%的发票问题。相比之下,低成本配置的解决率达到95%。一套匹配得当的中端配置则成功处理了全部44张发票,而其所用模型的价格仅为高端模型的一小部分。
所有失败案例都出现在同一项任务中:识别重复发票。这项具体任务要求人工智能同时评估五项彼此独立且相互竞争的规则,以判断两张发票是否匹配。能力最强的模型反而显得思虑过多:面对处于判定边界的匹配项,它倾向于保留意见;而决策空间更受约束的模型则会直接将其标记出来。单看书面指标,模型的基础能力很容易评估,但模型是否适合某项具体工作却不易判断;而真正决定本次研究结果的,恰恰是模型与任务的匹配程度。
诚然,44张发票的样本量较小,这些结果也不能视为对各类配置的最终排名。但研究结果足以表明,系统性能不能被想当然地视为理所当然。事实上,如果仅凭模型声誉作出选择,几乎所有人都会选用的那套配置,最终却排名垫底。
“能力陷阱”背后的三股力量
高端配置为何会陷入这一困境?我们的研究发现指向三个主要因素:模型过度思考、组件搭配不当,以及不必要的架构复杂性。
模型过度推演
规模较大的模型往往会生成更长、附带更多限定条件的推理过程。在开放式问题上,这是一项优势。但在直接明确、以规则为基础的检查任务中,这种特性会给原本可以由较简单模型明确判定的问题引入不确定性。我们在测试重复发票识别时遇到的问题,正是由此产生的。
组件搭配不当
我们最有价值的一项发现,来自一套以节约成本为目标的配置:该配置保留了高端推理智能体,但改用价格较低的模型读取文档。结果适得其反。在运行完全相同的智能体时,这套配置处理每张发票所消耗的计算资源增加了约68%。这是因为,智能体在着手执行实际任务之前,不得不先耗费推理资源,清理质量较差、更加杂乱的文本提取结果。一个环节节省下来的成本,转而成为下一个环节的额外损失。正如一份行业分析所概括的那样:输入的是垃圾,智能体输出的同样会是垃圾。自主系统的质量取决于其所有上游环节的质量。
不必要的架构复杂性
第三项研究结果也指向同一结论。我们使用完全相同的输入测试了两种设计:一种是简单的流水线式设计,各智能体按照固定顺序运行;另一种则更为复杂,由监督模块检查每一项输出,并可将任务退回重新处理。复杂设计的运行速度更慢,消耗的计算资源更多,准确率却与简单设计完全相同。不存在任何一个案例只被其中一种设计成功解决、另一种却未能解决。
这里需要强调一项重要的限定条件:我们的测试发票所包含的错误都有明确界定。对于真正模糊、也是人工团队最难处理的异常情况,重新尝试的能力很可能成为决定性因素。但只有在测量结果表明确有必要时,才应增加系统复杂性,而不应仅仅因为复杂的设计看起来更为严谨。
价值究竟来自何处
在我们研究的这家全球性企业中,某一区域分部能够在无须人工干预的情况下处理97%的发票,而另一区域分部的这一比例仅为67%。如果能够弥合这30个百分点的差距,每年将有数十万张发票转为全自动处理。当前面临的障碍其实十分常见,包括供应商针对不同币种持有多个银行账户、税务处理方式不一致,以及现有系统无法处理贷项通知单等。这些都需要结合具体情境作出判断,而基于规则的自动化系统始终无法完成此类判断。随着包括欧盟在内的不同司法管辖区逐步推行强制性电子发票制度,这类判断还将进一步增加。
更广泛的证据也指向同一方向。麻省理工学院NANDA项目的一项经《财富》杂志报道的研究考察了300个公开部署项目,并结合了对企业领导者的访谈和问卷调查。研究发现,约每20个试点项目中,只有1个能够迅速带来营收增长。研究作者认为,造成这一落差的原因并非模型能力不足,而是相关工具与其原本旨在改造的工作流程匹配不佳。这项研究结论引发了争议,其确切比例也存在分歧。但研究所揭示的总体方向更难反驳,并且与我们的观察一致:项目能否成功,较少取决于人工智能模型本身的基础能力,而在更大程度上取决于围绕该模型构建的整个系统。
我们访谈的财务负责人明确表示,他们并不希望打造一个自主运行的组织,而是希望建设一个由人工智能辅助的组织。我们的系统正是按照这一要求设计的:系统会记录每一步推理过程,以供审计;当系统无法解决某个问题时,它不会自行采取行动,而是起草一份问题摘要和建议采取的行动,交由人工审核。从一开始就将治理机制内置于系统,其成本远低于事故发生后再补建治理体系。
测试胜于采购
“能力陷阱”并不是反对采用AI智能体,而是反对以模型能力取代实证依据。形成以下两项实践习惯,将改变大多数部署决策:
- 针对具体任务开展基准测试,而不是依赖公开排名。在综合排行榜上领先的模型档位,面对实际需要完成的特定任务时,可能只能位列第三。要判断其真实表现,唯一的方法就是实际运行测试。
- 测试整条链路,而不是单个环节。智能体系统由一系列组件串联构成。孤立地改进其中一个组件,几乎无法说明整个系统的成本或可靠性将发生何种变化。
这两项习惯都取决于一个更早作出的第三项选择:将问题范围收窄到足以对结果进行测量。目标宏大的试点项目能够产出一套叙事,范围聚焦的试点项目则能够产出证据;而真正能够经受预算审查的是证据。
能够避开高德纳所预测40%失败率的组织,不会是那些行动最快或采购了能力最强模型的组织,而会是那些认真衡量成效、对各组件进行组合测试,并在确实需要判断的关键节点保留人工参与的组织。我们自己的研究结果来自一个刻意限定在较小范围内的问题,而三项研究发现全部与我们的预期相反。如果不开展此类测试就部署智能体,这就不是一项技术决策,而只是一次附带预算的猜测。
本文作者:
Rui Yang Teo,全球杰出青年美国剑桥—马萨诸塞州社区执委
本文原载于世界经济论坛Agenda博客,转载请注明来源并附上本文链接。
不要错过关于此主题的更新
创建一个免费账户,在您的个性化内容合集中查看我们的最新出版物和分析。
许可和重新发布
世界经济论坛的文章可依照知识共享 署名-非商业性-非衍生品 4.0 国际公共许可协议 , 并根据我们的使用条款重新发布。
世界经济论坛是一个独立且中立的平台,以上内容仅代表作者个人观点。
实时追踪:
World Models
分享:
每周 议程
每周为您呈现推动全球议程的紧要问题(英文)
更多关于 人工智能查看全部
Diego Vincenzi and Kenneth Cheng
2026年9月2日






