Grok 4.6 在 AI 排行榜拿了 61 分。这对你意味着什么?
每周我的 WhatsApp 都会收到一条消息,附带一张排行榜截图和一个问题:"Diego,值得换成这个吗?"。这次的截图是 Grok 4.6,xAI 的新模型,在 Artificial Analysis Intelligence Index 上拿了 61 分。这是个不错的数字。它把这个模型放进了精英组,和市场上最好的模型正面竞争。但在你掏出信用卡之前,值得先弄清楚这个 61 衡量了什么,没衡量什么,以及这和你的营收有什么关系。
什么是 Artificial Analysis Intelligence Index
Artificial Analysis 是一家独立公司,用尽可能一致的方式测试 AI 模型。他们选取一组标准化的测试:推理、数学、编程、常识、遵循长指令的能力、工具使用。所有测试在相同条件下运行,最后汇总成一个 0 到 100 的分数。
Grok 4.6 拿了 61。给你一个参照:如今的顶级模型在 60 出头的区间。又好又便宜的模型在 40 到 50 之间。一年半前的模型,当时看起来像魔法,现在低于 40。
所以是的,这是第一梯队的成绩。xAI 用了两年多一点的时间,从"推特上的聊天机器人"变成了真正的竞争者。
只是有一个细节,截图不会告诉你。
分数掩盖了什么
这个指数是一个平均值。而平均值会掩盖东西。
一个模型可能在数学上很出色,在遵循格式指令上很平庸。另一个可能在写中文文本上很优秀,在代码上很弱。两者最终得分可能一样。
就 Grok 4.6 而言,报告中引人注意的是两点的结合:高分和高速度。它回答快,思考也好。这很少见。通常模型在回答前"思考"得越多,就越慢越贵。
但报告也显示,它在某些地方比竞争对手消耗更多 token 才能得到同样的答案。用企业主的语言说:月底的账单可能比每百万 token 的标价暗示的要高,因为这个模型要多说很多话才能解决同一个任务。
排行榜衡量的是考试。你的企业衡量的是结果。
这个区别比任何基准测试都更有价值。
为什么排行榜上最好的模型可能是你最糟的选择
讲一个真实案例,名字换过了。
今年年初一家牙科诊所找到我。他们想自动化 WhatsApp 消息的分流:识别是预约、保险咨询、报价还是投诉,然后转到对应的地方。量级:每天大约 400 条消息。
合伙人看了一个排行榜,想要"最好的"。当时最好的输出价格大约是每百万 token 15 美元。
我们用诊所的 200 条真实消息测了三个模型。结果:
- 顶级模型:分类准确率 97%。
- 中端模型:准确率 96%。
- 便宜模型:准确率 94%。
第一和第二之间的差距是 200 条里的两条。成本是七倍。我们选了中端。一个小规模运营每月省下超过 600 雷亚尔,没有可感知的损失。
给患者消息分类和解奥数题不是一回事。排行榜测的是后者。你需要的是前者。
排行榜什么时候真正重要
我不想让你离开这里时觉得基准测试没用。它在三种情况下很重要:
当任务真的很难的时候。 带交叉条款的合同分析,复杂代码,需要交叉多个来源的报告。这时 55 和 61 的差距会在实践中显现,而且以代价高昂的错误显现。
当你要用智能体的时候。 智能体是那种独立分多个步骤执行任务的系统:打开表格,查询 API,做决定,继续。第 2 步的一个错误会污染后面的一切。更强的模型在中途出错更少,这会累积起来。
当你没办法事先测试的时候。 如果没法用你自己的数据跑试点,排行榜是现有最好的替代指标。肯定比厂商的广告强。
除此之外,排行榜只是好奇心。好的好奇心,但仅此而已。
不用成为专家也能选对模型
这是我和客户一起用的流程,精简到最核心:
- 精确定义任务。 "在客服中用 AI"不是任务。"把消息分成 5 类"才是。
- 收集 100 到 200 个真实样本。 来自你的数据,不是网上的例子。你的客户消息,你的文档,你的表格。
- 测试 3 个不同价位的模型。 一个顶级,一个中端,一个便宜。
- 把准确率和成本并排衡量。 如果便宜的准确率 94%,贵的 97%,问一句:每个错误要花多少钱?有时值得多付。大多数时候不值得。
- 让切换变得容易。 用一个中间层,允许你换模型而不用重写一切。三个月后排行榜又会变,你不想重做整个系统。
最后这一点是长期最省钱的。今天的 Grok 4.6 就是明天的中端模型。每一个曾经是"最好"的模型,我都见过这种事发生。
那 Grok 4.6 值得吗?
我的真实看法:如果你已经有东西在跑,想做对比,值得测试。不值得冲动切换。
这个模型有能力,速度快,xAI 在基础设施上投入很大。但它是一家年轻的公司,有过方向急转的历史,周围的工具生态仍然比竞争对手小。对于一家每天都依赖系统正常运转的企业来说,供应商的稳定性和排行榜分数同样重要。
如果你的 AI 运营依赖于一个每周都在变的数字,问题不在模型。而在于缺少选择的方法。
这正是我帮助企业做的那类决策:用真实数据测试,衡量真正重要的东西,搭建一个排行榜变动时不会崩的自动化。如果想聊聊你的情况,在这里更多地了解我。
LinkedIn 摘要
Grok 4.6 在 AI 排行榜拿了 61 分。那又怎样? 每周我都会在 WhatsApp 收到一张排行榜截图,配上同一个问题: "Diego,值得换吗?" 排行榜衡量的是考试。你的企业衡量的是结果。 我用一家诊所的 200 条真实消息测了三个模型:顶级模型准确率 97%,中端 96%,便宜的 94%。最贵的那个价格是七倍, 差距只有两条消息。 如果你的 AI 运营依赖于一个每周都在变的数字,问题 不在模型。而在于缺少选择的方法。 想知道如何用真实数据而不是截图来做选择?找我聊聊。 #人工智能 #自动化 #企业AI #Grok #科技