返回博客
人工智能自动化商业

Opus 5 登顶 AI 排行榜:这对你意味着什么

2026年8月23日·7 分钟阅读·Diego Horvatti

每次出新模型,就有人发消息问我是不是要"全部换掉"。这周是因为 Opus 5,它在 Artificial Analysis 的 AI 排行榜上拿了第一。那个榜单比较各家模型在推理、代码和知识测试上的表现。问题问得没错。答案却几乎总是让人失望:对你的生意来说,大多数情况下改变不大。而改变的那一小部分,非常具体。

我来讲清楚这个榜单测的是什么,一个更强的模型在哪里真的会体现在结果上,又在哪里完全没有差别。

这个 AI 排行榜到底测什么

Artificial Analysis 会对模型跑一整套标准化测试,然后汇总成一个分数。有难度很高的数学题,有研究生水平的科学问答,有竞赛编程挑战,还有多步推理。这个指数把这些结果混在一起排序。

有用。但也有局限。看看它测的是什么:封闭式问题,有标准答案,不涉及任何公司的实际情况。

你的生意不是这样的。你的问题是"这个客户回复报价时提了个模棱两可的疑问,结果两天没人看到那条消息"。没有任何基准测试在测这个。那里的瓶颈不是模型的智力,而是没人搭好从微信到决策人之间的那条路。

我见过公司开一整场会讨论用哪个模型,而网站的表单把客户线索发去了一个从 2023 年起就没人打开的邮箱。模型是这里面最小的问题。

换模型很容易。难的是搞清楚你想让它做什么。

更强的模型,真正体现在哪里

话说回来,这也不是空洞的营销。有三个地方,用的人是能明显感觉到质量跃升的。

无人盯着的长任务。 以前你提一个要求,检查一遍,再提下一个。现在可以丢一个十步、十五步的任务,结果从头到尾都保持连贯。这改变了值得去搭的自动化类型。一个读取表格、跟系统数据对照、找出不一致再写出摘要的流程,现在变得可靠了。两年前,它会在第四步崩掉。

质量差的文档。 扫描歪了的合同,来自完全不讲规范的供应商的 PDF 发票,带三层表头和合并单元格的表格。老模型偏偏在你最不能出错的地方出错:数字、日期、金额。现在的模型准确率高多了。它们仍然会错,所以你还是要复核。但复核从"全部核对一遍"变成了"核对它标记为存疑的部分"。

不像机器人的回复。 自动客服不再像那种按键菜单了。模型明白"那个方案还有效吗?"和"你们看到我上周的邮件了吗?"是同一个问题的两种情绪,然后据此作答。

注意,这三点在排行榜上都体现不出来。榜单测的是数学题。改变你日常的,是它在又长又枯燥的任务上的可靠性。

什么没变,而且不会变

这才是最要紧的部分。

模型对你的公司一无所知。它不知道 X 客户总是晚十五天付款,而且这没关系。它不知道七月的促销规则不一样。它不知道最新的价格表存在哪个文件里。这些都不在训练数据里,再新的版本也猜不出来。

也就是说,搭一套好用的自动化,要做的活跟以前完全一样:

  • 找出时间到底流失在哪里
  • 把如今只存在于某个人脑子里的规则写下来
  • 把需要互通的系统连起来
  • 决定哪些让 AI 自己做,哪些必须有人盯着
  • 用真实又难看的案例去测,不是用漂亮的示范样本

一个项目大概八成的工时都花在这上面。选模型是五分钟的决定,而且可以反悔:今天换模型只要改一行配置。

所以,等下一次发布再开始,是最糟糕的计划。你为了简单的部分,推迟了困难的部分。

一个具体的例子

常见场景:一家事务所每天收四十封邮件,其中二十封是重复的事务性内容。补开单据、问期限、确认预约。有人每天要在这上面花两小时。

我搭过这样一个流程。自动化读取邮箱,分成五类,需要时去系统里取数据,然后写好一封回复。它不自己发出去,而是留成草稿。

第一周,那位同事认真读完每一封才批准。两小时变成了五十分钟。到第三周,她扫一眼就能批量通过。二十分钟。那些奇怪的案例,一天两三封,按正常流程转给她,还附带一句"这封没归到任何一类"。

让这个项目成功的不是模型,而是留成草稿、不直接发送的那个决定。它建立了信任,而信任才是后面能扩大规模的前提。换更强的模型,分类会好几个点,草稿也会更到位。不错。但如果我第一天就让它自己发出去,一个低级错误就能毁掉整个项目,换世界上任何模型都一样。

"那我该无视这些排行榜吗?"

不。别把它当成采购理由,把它当成温度计。

如果你 2024 年请人搭过一套自动化,效果不上不下,那值得重新聊一聊。当时做不到的事,现在已经稀松平常。复杂文档的信息提取就是最明显的例子。多步骤串联的流程,也是。

如果你在客服里用了 AI,还是有那种"一听就是机器人"的感觉,那多半是模型太老,或者指令写得不好。这两个问题,一个下午就能解决。

如果你现在还完全没用 AI,那这个榜单今天对你没什么用。它只是告诉你工具已经够好了。这个你早就知道了。

一个实际的细节:越强的模型,单次使用成本越高。不是每个任务都需要榜首那个。把邮件分成五类,一个又小又便宜的模型跑得完全没问题。写一份合同分析,那才值得用贵的。实际操作中我会在同一个流程里混用两者,月底的账单会感谢你。

周一可以做什么

如果你想从中获益,又不想被发布新闻牵着走,只做一件事就够了:挑一个团队里每天要占掉某个人一小时以上的重复任务,在纸上写下这个人执行的确切步骤。

就这些。不用工具,不用注册任何账号。

如果你写得出这些步骤,就能自动化。如果写到一半卡住了,因为"要看情况",那你就找到了人的判断真正重要的那个点,而那里正是你留住人、把其余部分自动化的地方。

再过几个月,排行榜又会变。会有人超过 Opus 5。而你内部的流程,仍然是你自己的问题。好消息是,它是唯一真正值得去解决的那个,因为不管谁在榜首,它都会改善你的结果。

想聊聊你们的业务里哪件事最值得先自动化,来找我聊。不绕弯子,我看一眼你的情况,直接告诉你值不值得。

LinkedIn 摘要

每周都有人问我,出了新模型是不是要"全部换掉"。

这周是 Opus 5,它登上了 Artificial Analysis 排行榜的第一名。

答案有点让人失望:对你的生意来说,改变不大。这些排行榜测的是数学题和竞赛编程。你真正的瓶颈,是那条卡了两天的线索,躺在一个没人打开的邮箱里。

我见过公司开一整场会讨论选哪个模型,而网站表单把客户信息发去了一个从 2023 年起就没人看过的邮箱。

今天换模型只是改一行配置。真正的工作,是找出时间漏在哪里,把只存在于某个人脑子里的规则写下来,再决定哪些环节必须有人盯着。

等下一次发布再开始,就是为了简单的那部分,拖延困难的那部分。

你的团队里,哪件重复的事每天要花掉一个多小时?告诉我,我帮你判断值不值得自动化。

#自动化 #人工智能 #生产力 #数字化转型 #AI