返回博客
AI 智能体自动化商业

AI 智能体:排行榜变天了,然后呢?

2026年9月04日·6 分钟阅读·Diego Horvatti

六个月前你选定了一个 AI 工具。付了钱,培训了团队,接进了系统。昨天新排行榜出来了,你的选择已经不在第一名。那怎么办,全部推倒重来?

不用。但值得弄清楚发生了什么,因为这种事还会再发生。Artificial Analysis 的 AI 智能体排行榜衡量的是模型执行真实任务的能力,而不只是回答问题,这次把 Qwen3.8 Max 排到了榜首。这是阿里巴巴的中国模型。它超过了那些你大概叫得出名字的对手。而三个月后,大概率又会有别的模型超过它。

这才是真正的新闻。重点不是哪个模型赢了。是冠军换人的速度。

什么是「智能体指数」,为什么它更重要

早期的 AI 排行榜衡量知识。问一堆问题,看谁答对得多。看着挺好,但对做企业的人几乎没用。

智能体指数衡量的是另一件事:模型能不能做成一件事。打开一个系统,取一条数据,和另一条比对,做出判断,执行。这是一串步骤,每一步的错误都会污染下一步。

这就像一个知道很多东西的实习生,和一个能独立解决问题的实习生之间的差别。前者吃饭聊天很愉快。后者你舍不得辞。

实际上,这个指数回答了真正要紧的问题:这个模型能不能扛下一个十步的任务而不在中途走丢?因为这正是你的业务需要的。没人会去自动化「写一段文字」。要自动化的是「接单、查库存、开发票、通知客户、更新表格」。

一个中国模型排第一说明了什么

说明这件事变成大宗商品的速度,比很多人预想的快得多。

两年前,领跑者和其他人之间有明显的差距。今天是一个集团军。五六个模型在小数点后互相厮杀,每次发布都换一次座次。其中一些的价格只是当年报价的零头。

这对你是好事,对把宝全押在一家供应商身上的人是坏事。

当第一名每个季度都在换,选第一名就不再是策略。

当然还有数据在哪里跑的问题。如果你要处理客户的敏感信息,服务器所在的国家很重要,而且是法律层面上的重要。但这是架构决策,不是无视正在发生的事情的理由。这些模型里有好几个可以本地部署,或者跑在巴西的云上。这个我写过了。

我看到企业常犯的错

我说直接一点,因为这是我聊得最多的情况。

公司采购了一个 AI 工具,工具里内嵌了一个模型,是供应商选的。换不了。然后模型落后了,或者价格翻了三倍,你才发现整套自动化都建立在别人替你做的一个决定上面。

我见过一家经销商,把 WhatsApp 上的订单分拣全部搭在一个封闭平台上。用了八个月,一直挺好。后来供应商改了套餐,每次对话的成本涨上去了,而要更换就意味着从零重做。他们算了一笔账:迁移要 40 天左右,而当初搭起来只花了 12 天。

问题不在于选了哪个模型。在于没有留一扇门。

怎么搭一套能撑过下次换榜的自动化

规则很简单:模型是零件,不是地基。

让你的自动化跑起来的不是模型,是它周围的东西:

  • 数据。 信息从哪里来,怎么干净地送进来,谁来维护。
  • 规则。 智能体能做什么,不能做什么。在哪里停下来叫人。
  • 测试。 一组来自你公司的真实案例,任何新模型上来都跑一遍。
  • 切换点。 代码里唯一一个决定用哪个模型的地方。

这四样立得住,换模型就是一个下午的活。你把排行榜上的新冠军拿过来,跑你那三十个测试用例,比对结果和成本,然后决定。没有戏剧性。

立不住的话,每次更换都是一个项目。

切换点是最便宜的一环,也是最多人跳过的一环。具体说:与其把调用模型的代码散在十五个文件里,不如集中在一个文件。系统其他部分只跟这一个说话。换发动机就变成改一行。一开始做几乎不花钱,事后再做要花几周。

那测试呢?怎么知道新模型对你更好

公开排行榜测的是通用任务。你的公司不通用。

自己攒一套。不需要多精致。找 20 到 40 个真实发生过的案例,你清楚正确答案是什么。含糊的订单、语义不清的邮件、缺字段的发票。那些让人头疼的情况。

然后,新模型出来的时候,你跑这 30 个案例,看三个数字:

  1. 对了几个。 显而易见,但必须写下来。
  2. 花了多少钱。 把 30 个的成本加起来,乘以你的月均量。
  3. 花了多久。 如果客户在 WhatsApp 上等回复,40 秒和 4 秒是两回事。

一个准确率高 2%、价格贵三倍的模型,对你不是更好。它是在排行榜上更好。这是两码事。

我见过一个便宜模型在发票数据提取这个具体任务上赢了「世界最强」,原因很简单:任务很窄,而那个贵模型在白白消耗推理。排行榜不知道这件事。那 30 个案例知道。

这周可以做什么

如果你已经有 AI 自动化在跑,三个问题:

你知道背后是哪个模型吗?如果答案是「我猜是 OpenAI 的吧,但不确定」,这本身就是个信号。

你换得掉吗?问供应商,或者问当初搭这套的人。如果答案里带着「那就得重做了」,你就知道风险有多大。

你有办法比较吗?如果从来没人写过测试用例,那就写。找真正在一线做这件事的人,花一个下午,把那些经常出问题的情况列出来。这是整个项目里最耐久的资产,因为它能活过任何一次模型更换。

如果你还什么都没跑起来,那更好。你可以一开始就用对的结构,不背任何人的技术债。

排行榜还会再变。大概圣诞节之前就变。问题不是谁会在榜首。而是那一天到来的时候,你读这条新闻是带着恐惧,还是带着好奇。

如果想聊聊你的自动化是怎么搭的,或者怎么搭一套不会把你锁死的,看看我是谁,然后给我发条消息

LinkedIn 摘要

六个月前你选定了一个 AI 工具。昨天新排行榜出来了,它已经不在第一名。

那怎么办,全部推倒重来?

不用。但信号很清楚:冠军每个季度换一次人。选第一名已经不算策略了。

让你的自动化活下来的不是模型。是数据,是规则,是用你公司真实案例做的测试,还有代码里那个唯一可以换模型的地方。

这四样立得住,迁移只要一个下午。没有这四样,每换一次都变成 40 天的项目。

想聊聊你那套是怎么搭的,可以找我:三个问题就能看出风险有多大。

#人工智能 #AI智能体 #自动化 #数字化转型 #科技