返回博客
AI 智能体自动化商业

AI 智能体:排行榜又换主人了

2026年8月28日·6 分钟阅读·Diego Horvatti

四月的时候,你批准了一个自动化项目,依据是“市面上最好的模型”。到了八月,最好的模型已经换了。而且很可能是中国的。

Qwen3.8 Max 登上了 Artificial Analysis 智能体指数的榜首。这个指数衡量的是模型能不能独立完成多步骤任务,而不只是把问题答得漂亮。这已经是今年第三次换榜首。如果你是企业主,正在琢磨该往哪押注 AI 智能体,这条新闻看起来很重要。它其实没有看上去那么重要,下面我说说为什么。

这个排行榜到底在衡量什么

一个模型会聊天,和一个模型会干活,差别很大。

会聊天,是回答一个问题。会干活,是接到“把这张表里的订单整合一下,查出哪些还缺发票,然后给我一份摘要”,然后按正确的顺序把三件事做完,中间不瞎编数据。

智能体指数想衡量的就是第二件事。它让模型去用工具、去浏览网页、去写代码、去查系统、去完成长任务。这是最接近你真实需求的测试:你要的是一个动手的人,不是一个发表意见的人。

有意思的数据在这里。在这类测试中,第一名和第五名之间的差距很小。差的只是几个百分点。第一名能上头条。但在实际使用中,如果你的流程用第五名跑得通,用第一名也跑得通,反过来也一样。

为什么换模型很少能解决你的问题

我直说:在我见过的几乎所有失败的自动化项目里,模型都不是罪魁祸首。

真正的原因通常是这三个:

  • 数据乱。 智能体读的那张表里,同一个客户写成“Silva ME”“Silva Me”和“silva 小超市”。排行榜上没有任何一个模型能自己把这个理清楚。
  • 流程没定义。 订单来了但没有税号,接下来该怎么办,没人能用文字讲清楚。人都不知道,智能体自然也不会知道。
  • 拿不到数据。 存着关键信息的系统没有对外接口,得到的回答是“每周五小张手动导出一次”。

这三个问题的代价,比任何模型之间的差距都要大。而且它们处理起来很烦,这也解释了为什么很多人宁愿去争论哪个 AI 最强。

换模型很容易。理顺流程才是真正的工作。

那个要花两天的报价单

我的一个客户是家经销商,流程是这样的。业务员在 WhatsApp 上收到订单,通常是一张手写清单的照片,或者客户发来的 PDF。他把内容全部录进系统,核对库存,算运费,做出报价单,再发回去。忙的时候,一份报价单平均要两天。

我们做了一个智能体来处理机械的部分:读订单、在商品目录里识别出对应的商品、查库存、生成报价单草稿。业务员来审核和批准。时间降到了二十分钟左右。

让它跑起来的不是模型。是之前那一个月,花在三件毫不光鲜的事情上:

  1. 统一商品目录,因为同一个商品原本有四种不同的叫法。
  2. 用文字写清楚:智能体不确定的时候该怎么做(答案是停下来提问,绝不瞎猜)。
  3. 把业务员放在流程的末端,给他一票否决权。

当时用的那个模型,从那以后已经换过两次。流程还是那套流程,每次切换只花了一个下午。这才是重点。

那排行榜就一点用都没有了?

有用。只是它的用处和大多数人以为的不一样。

它能让你看清市场的方向。方向很明确:Qwen 这类中国开源模型正在追上美国模型,价格却只是零头。这会改变你项目的账。

一个每天跑一千个任务的智能体,用贵的模型,一个月可能要好几千。同样的智能体,换成一个有竞争力的开源模型,可能只要几百。当质量差距在基准测试里只有两分,价格差距却有五倍时,这个决定就没那么哲学了。

它还能帮你校准预期。今天最好的模型,在测试环境下完成复杂智能体任务的成功率大约在 60% 到 70%。不是 99%。如果有人向你兜售一个“完全无需监督、什么都自己搞定”的智能体,问问他有哪个基准测试能支撑这句话。答案会很有意思。

怎么决策,才不会被头条牵着走

一个实用的顺序,是这样的:

先选流程,不是先选技术。 挑一件重复性高、规则清晰、又在消耗贵人时间的活。报价、邮件分流、单据核对、一线回复都行。如果这件事需要细腻的判断,或者出错代价太高,先放一放。

做成可以换引擎的。 这是开发方的责任,但你可以提要求。问供应商的正确问题是:“如果三个月后出来一个更好或更便宜的模型,换掉它要花多少工作量?”如果答案是“全部重做”,那这个项目的设计有问题。

开工前先量。 这件事现在要花多长时间?每个月出多少次错?没有这两个数字,你就没法证明自动化值不值,最后只能凭感觉下结论。

在决策点上留一个人。 不是因为 AI 笨,而是因为责任还在你身上。智能体准备,人来批准。效果更好,觉也睡得更踏实。

换我是你,我会怎么做

接下来六个月,别管排行榜。它还会再变,多半用不了六个月。

把这段时间用来选定一个流程,把它真实的运作方式写下来(不是手册上写的那套),再把它用到的数据清理干净。等这些都就位,在上面接一个智能体只是几周的事,而且你想换多少次模型都可以,什么都不用重做。

自动化最难的部分从来不是 AI。一直都是把自己的流程搞懂到能讲给一个从没在你公司待过的人听。只不过现在这个“人”是一台机器,而它非常字面。

如果你心里已经有一个流程,想听一句实话,看看值不值得自动化,跟我说说你现在是怎么做的。有时候答案只是一张更好的表格,这话我也会照说。

LinkedIn 摘要

四月的时候,你批准了一个自动化项目,用的是“市面上最好的模型”。到了八月,最好的已经换成另一个,而且很可能是中国的。

Qwen3.8 Max 登上了智能体排行榜第一。这是今年第三次换榜首。

但在我见过的几乎所有失败的自动化项目里,模型从来不是罪魁祸首。真正的原因是数据乱、没人能把流程写清楚、系统之间没有打通。

我的一个客户把报价流程从 2 天压缩到 20 分钟。让它跑起来的是花了一个月清理商品目录、定好规则,不是那个当红的 AI。从那以后模型已经换过两次,每次只花了一个下午。

接下来六个月,别管排行榜。把这段时间用来搞懂你自己的流程。

如果你手上有一件重复性的活,想听一句实话,看看到底值不值得自动化,来找我聊。有时候答案只是一张更好的表格,这话我也会照说。

#人工智能 #自动化 #生产力 #科技 #商业