最强大的模型并非商业赢家
阿里巴巴.com总裁选择用一个数字开场,而这个数字令人不安:61.7%。这是他们测试过的最佳人工智能智能体在真实商业任务中成功完成的比例。在107个真实电商操作中,现有最强系统有将近四成的任务以失败告终。
郭璋(Kuo Zhang)选择这个数字,并非为了道歉,而是为了构建一个论点——关于超越"最聪明模型竞赛"之后将会发生什么。从采用心理学的角度而非技术架构的角度来解读这个论点,它传达出一个比任何基准测试都更令人不安的信息:那些继续将原始算力视为差异化优势的企业,正在误判真正的战场所在。
Fast Company发表的这篇报道介绍了CommerceAgentBench——阿里巴巴.com基于真实操作构建的开源测试基准。其方法论与传统的语言基准测试截然不同:它衡量的不是模型能否生成一个合理的回答,而是任务是否真正完成。采购订单是否已下发,商品列表是否正确发布,货运是否按规格预订。这种二元成功标准使该基准更接近企业衡量人工工作的方式,而与人工智能行业过去数年衡量进步的方式相去甚远。
在对107个任务运行不同模型后,他们发现的并非清晰的排名层级,而是碎片化的结果。在报价和市场调研方面领先的模型,在索赔处理和商品合规方面却落于人后。第三个系统在产品发布和退货管理方面效率最高。没有任何一个模型能全面制胜。这种分散性并非技术偶然,而是整个论点的核心所在。
单一模型的幻觉与无人计入成本的认知代价
过去两年,大多数企业采纳人工智能的方式遵循一个可识别的模式:选择当前最强大的模型,将其接入现有工作流程,然后期待算力弥补设计的缺失。这种做法可以理解。它降低了决策的复杂性,避免了深入理解每个模型在每种情境下表现如何的不适,也让采用该技术的团队感觉自己做出了正确的决定——因为他们选择了最昂贵、最知名的方案。
这种模式在行为经济学中有一个名称:属性替换启发式。当一个问题很难回答——我的二十个运营工作流分别适合哪个系统——人们会用一个更容易回答的问题来替代它:哪个模型是现有最好的。第二个问题的答案被套用到第一个问题上,而没有人意识到这种替换。
这种替换的代价在被量化之前是隐形的。阿里巴巴.com对44个任务进行了量化,发现其智能体Accio——根据难度和所需推理类型在模型之间分配工作——的token成本为1.72美元。Codex的成本为3.79美元,Claude Code为3.91美元。差异并非来自在所有情况下都使用更便宜的模型,而是来自在不必要时不使用最昂贵的模型。
这个数字并非投资回报率的承诺,而是底层运行机制的一个信号。当一家企业以最强大的模型为标准进行整合,因为这样可以简化决策,它实际上是在为不需要高复杂度推理的任务支付高复杂度推理的费用。从运营角度来说,这相当于为了避免决定谁该归档、谁该分析,就把最优秀的分析师派去整理文件。
张先生的提案将其称为精准授权:为每个工作流分配该流程具体所需的能力级别和权限。这个概念在组织管理中并不新鲜。新鲜之处在于,它现在适用于自动化系统,而且不这样做的代价,在大规模运营人工智能的可变成本上有直接体现。
为什么采用在技术问题之前就停滞了
Fast Company的文章以迂回的方式提及了一个值得更深入审视的维度:授予智能体的自主程度与其错误的运营后果之间的关系。
张先生用一个直接的区分来阐述这个问题。社交媒体发帖草稿质量差,产生一种后果;向供应商付款出错,则产生另一种后果。这种差异不仅是技术层面的,更是企业环境中采用心理问题的核心所在。
在低后果流程中引入人工智能工具的企业——文本生成、摘要、内部草稿——摩擦相对较低。错误是可见的、可纠正的,不会产生即时的财务损失。使用者对最终结果保持控制权。其职业身份不会受到威胁,因为系统在对世界产生影响之前仍经过其判断筛选。
这种逻辑崩溃的时刻,是智能体直接连接到执行操作的系统时:付款、库存、物流、采购订单。此时,方程式发生了根本性的改变。错误不再是一份被丢弃的草稿,而是错误的发货、重复的付款、配置错误的采购订单所产生的合同义务。而授权自动化的人,即便未直接介入,也要承担这个错误的责任。
这种责任的转移而没有相应控制权的转移,是运营型人工智能采用中最被低估的心理障碍之一。企业停滞,并非因为团队不理解这项技术,而是因为团队非常清楚:当智能体在高影响任务中失败时,错误会有具体的人名。而那个名字通常是批准自动化的人。
从这个角度来看,最佳模型在真实商业任务中61.7%的完成率,是一个在两个相反方向上同时作用的数字。对于将其视为采用论据的人来说,它表明现有能力已足以在监督下实现自动化。对于从责任恐惧角度解读的人来说,它意味着近四成的任务会失败,而这些失败发生在连接着资金、库存和供应商的系统中。
这两种解读都没有错,它们只是同一个数字的两面。而决定授予智能体多大权限的企业,实际上是在做一个决定:在建立充分的绩效证据之前,愿意将多少错误风险向下分散到组织结构中。
Harrison Nott案例及其揭示的论点局限
文章以Harrison Nott的例子作为结尾——一位16岁的年轻人,他使用阿里巴巴.com和Accio开发了一个冷却产品业务,据Fast Company报道,该业务已创造了100万美元的营收。从叙事角度来看,这个案例选择得很好:它说明了过去只有拥有预算和专家团队才能获取的能力,现在一个没有企业架构的个人也能触手可及。
然而,这个例子也在不经意间揭示了精准授权论点中一个重要的不对称性。
对于一个对自己决策拥有完全自主权的个人创业者来说,关于向智能体授权多少的问题几乎是个伪命题。如果智能体犯了错,成本由做出决定的同一个人承担。不存在需要问责的组织层级,没有干扰的遗留系统,也没有询问遵循了哪些审批流程的合规团队。
在这种情境下,采用摩擦极小,效用立竿见影,精准授权模式之所以有效,是因为使用者既有采用的动力,又有承担错误的灵活性。
问题在于,这种情境并不能描述大多数精准授权承诺最有价值的组织。一家拥有ERP系统、审批流程、财务部门和内部审计人员的中型企业,面临着完全不同的摩擦架构。在那里,采用一个根据难度和成本标准在多个模型之间分配工作的系统,不仅需要一个技术决策,还需要协调治理标准、定义异常处理协议,并建立一套证据层,以支持逐步扩大智能体权限的合理性。
这一层并不昂贵,技术上也不复杂。但在目前呈现的论点中,它是隐形的——而它恰恰是决定精准授权能否从概念转化为实践的关键,尤其是在一个拥有多重利益和分散责任的结构中。
优势不在于模型,而在于积累的信任证据
郭璋的论点作为成熟度路线图来解读,比作为即时采用提案来解读更为有效。在下一阶段运营型人工智能中获得优势的企业,未必是那些获取最强模型的企业,而将是那些已构建评估基础设施的企业——这些基础设施能让它们逐个工作流地知道哪个模型表现最好、成本几何,以及在什么条件下扩大系统自主权是安全的。
这种基础设施并不光鲜,不会出现在产品发布公告或公开基准测试中。但它是将人工智能作为实验采纳的企业与将其纳入可持续运营能力的企业之间的本质差异。
CommerceAgentBench在其最精炼的形式中所提出的是:任务层面的持续绩效评估本身就是一种战略能力。不是你今天使用的模型,而是衡量其真实绩效、调整任务分配、并在智能体积累可靠性证据时逐步扩大其权限的能力。
这种基于已证明绩效逐步扩大权限的过程,与成功组织管理人员的方式有直接的对应关系。一名新员工不会立即获得所有系统的访问权限,也不会在未经审批的情况下就拥有调用资源的权力。随着其绩效产生足够的证据,证明他能够在不造成代价高昂的错误的情况下行使这种权力,权限才会逐步扩大。
将同样的逻辑应用于人工智能智能体,并非对技术潜力的保守限制,而是解决核心心理障碍的唯一途径——正是这一障碍阻止了企业将采用从低后果流程推进到那些财务影响足以证明投资价值的运营环节。
下一个周期的优势不属于拥有最聪明模型的人,而属于那些已经建立起流程的人——知道何时可以将重要任务委托给智能体,并以绩效数据作为支撑,当错误最终发生时,有人能够拿出数据说明情况。因为错误终究会发生,而一家企业能够消化错误还是会被错误拖垮,取决于它有没有协议——而不是仅凭希望。











