AI 基准测试:为什么排名什么都决定不了
团队里有人在群里发了张截图:“出了个新模型,排第一。”于是你脑子里冒出一个烦人的疑问:我们上个月搭的那套,是不是已经过时了?
最近的例子是 Grok 4.6,它在 Artificial Analysis Intelligence Index 上拿了 61 分。这个分数很高。这是真实的结果。而对你的公司来说,它大概什么都改变不了。这就是把 AI 基准测试当成联赛积分榜来追的问题:你知道了谁在前面,但不知道那能不能解决你的问题。
我来讲讲这个数字到底是什么,它藏住了什么,以及真正决定一个 AI 项目在企业里能不能跑通的是什么。
AI 基准测试里的“61”是什么意思
Artificial Analysis Intelligence Index 是一个平均值。他们让模型跑好几种不同的测试(数学、代码、推理、科学知识、工具使用),再把结果汇总成一个 0 到 100 的指数。
注意这个细节:这是多场考试的平均分。就像学校成绩单上的平均分。一个平均分 8.5 的学生,可能数学很强,写作很差。平均分恰好掩盖了你最需要的信息:要不要请这个学生来帮你写文案。
还有一个几乎没人提的细节:榜单顶部很挤。今天最好的那几个模型,分数都堆在差不多的区间里。第一名和第四名之间的差距,比同一个模型上“写得好的提示词”和“偷懒的提示词”之间的差距还小。
也就是说:排名变了,但你的结果更多取决于你怎么用这个工具,而不是那一周谁排在最上面。
为什么榜首每六周就换一次
因为竞争就是这样运转的。xAI、OpenAI、Anthropic 和 Google 在一场没人能落后太久的赛跑里。出一个模型,领先几周,下一个就来了。
如果你想永远用第一名的模型,你会花一整年在迁移上。而迁移是有成本的:
- 重做和重测提示词,因为每个模型的回应方式都不一样
- 重新验证那些本来跑得好好的集成
- 重新培训每天用它的人
- 发现只有上了生产才会冒出来的新 bug
这一切,只为了在一个衡量数学考题的指数上多拿两分。不划算。
每次排名变动就换模型,就像每次出了更快的车就换车。你哪儿也到不了,只是一直在换车。
基准测试没测的东西(而它才是月底找你收钱的那个)
下面这部分,对付账单的人最重要。这个指数衡量的是原始能力。它没测四件决定项目成败的事:
单任务成本。 一个模型可能聪明 3%,价格贵 5 倍。如果你每月处理两万份文档,这笔账很快就显形了。还有一个大家忽略的点:推理型模型在回答前会“思考”,而这个思考是计费的。两个 token 单价相同的模型,最终成本可能差很多,因为其中一个更啰嗦。
速度。 一个要 40 秒才回复的虚拟客服,就是一个客户已经离开的虚拟客服。这种情况下,更小更快的模型每次都赢过榜单冠军。
一致性。 基准测试跑一次,记下结果。你的公司每天跑同一个任务 800 次。重要的不是最好的可能结果,而是可接受的最差结果。一个准确率 99%、出错方式可预测的模型,比一个准确率 99.4%、出错方式离奇的模型更有价值。
你的上下文。 没有任何基准测试拿你的价目表、你和客户说话的方式、你的折扣规则去测过模型。这属于集成工作,而 90% 的差异就出在那里。
一个具体的例子
我给一家服务公司做过邮件分拣自动化。商务邮箱每天进来大约 300 封邮件,报价请求、老客户咨询、催款和垃圾邮件混在一起。有人每天花两个小时在分拣。
我测了三个模型。最贵、榜单排名最高的那个,分拣准确率 96%。一个便宜得多的中档模型,准确率 94%。
猜猜最后选了哪个?中档的。因为 2% 的差距意味着每天有六封邮件落进错误的分类,而这六封邮件一个人五分钟就复核完了。至于成本差距,大到足以改变关于项目预算的整场对话。
还有一个没有任何基准测试预见到的效果:真正的提升不是来自模型。它来自重写分类。这家公司原来的分类互相重叠,连人都没法在“技术咨询”和“客服支持”之间做决定。我把这个理顺之后,两个模型都变好了。
瓶颈是问题的定义,不是机器的智能。几乎总是这样。
那我什么时候该换模型?
有三种情况值得动已经在跑的东西:
-
任务换了量级。 你一开始只是分类邮件,现在想让 AI 起草技术方案。不同的任务需要重新评估,而不是看排名。
-
成本变了。 如果出现一个能做同样的事、价格只有一半的选项,值得测一测。这种事经常发生,而且是比“新模型登顶指数”好得多的消息。
-
你真的撞到天花板了。 不是“我觉得应该能更好”,而是:你量过了,你知道错误率,而它已经超过业务能承受的范围。
除此之外,让它继续跑。能用又没人动的软件是资产,不是落后。
如果从这里开始你只做一件事,那就做这件:用你业务里 50 个真实案例搭一个测试集。已经发生过的案例,标好正确答案。等新模型出来,你跑一遍这 50 个案例,二十分钟就有答案。这比任何公开指数都值钱,因为它衡量的是你需要衡量的东西。
下一条头条来了怎么办
下次有人在群里发排行榜截图,有用的问题不是“我们该换吗?”。而是:“我们哪个任务现在的结果不好?”
如果一个都没有,那太好了。排名是科技新闻,不是商业决策。如果有,那你在新模型出来之前就已经有问题了,而新模型未必是解药。
企业里做 AI,难的部分从来不是选模型。而是决定自动化哪个流程,定义什么算正确答案,以及把它接进现有系统而不弄坏别的东西。这部分不会出现在任何基准测试里。
如果你想弄清楚 AI 到底能在你的业务里帮上什么忙,而不用每六周换一次工具,跟我说说你在做什么,我们一起看看。
LinkedIn 摘要
“出了个新模型,排第一。”那我们要换吗? 答案几乎都是不换。 我给一个客户做过邮件分拣:排行榜冠军模型准确率 96%。中档模型便宜得多,准确率 94%。我选了中档的,因为每天多出的那 6 封邮件,一个人 5 分钟就处理完了。 而最大的提升根本不来自模型。它来自重写分类,原来的分类互相重叠,连人都判断不了。 瓶颈几乎总是问题的定义,不是机器的智能。 如果你想聊聊 AI 到底能在你的业务里帮上什么忙,随时找我。 #人工智能 #自动化 #企业AI #科技