本地 AI 智能体:当 AI 离开云端
你算过每个月在 AI 接口上花多少钱吗?我算过。有个客户,这个数字六周内从 90 雷亚尔涨到了 1100。没有任何东西出故障。只是智能体开始全天候运行,查邮件、给订单分类、更新表格。每次检查几分钱。乘以每天 4000 次检查,账单就出来了。就是在这个节点上,本地 AI 智能体不再是极客的闲聊,而变成了管理层的话题。
Meta 发布了 Muse Glimmer,一个 300 亿参数的模型,做的正是这件事:常驻运行的智能体,跑在你自己的机器上。它不是世界上最聪明的模型。它本来就不是为那个而生的。它是为了随时待命,而且不按小时收费。
智能体跑在你自己机器上,会有什么不同
今天你用 AI 做自动化,常规路径是这样的:你的信息离开公司,发到美国的服务器,处理完再回来。效果不错。但要过三道收费站。
第一道是钱。你按用量付费。一直在跑的自动化,就是一直在计费的自动化。
第二道是延迟。每次来回要半秒到几秒。听起来不多。但在一个十二步的流程里,就变成半分钟的等待。
第三道是数据。客户合同、患者档案、工资表。这些全都往外传。安全地做得到,但很费劲,而且在受监管的行业里,这是跟法务的一场长谈。
跑在本地,三道收费站一次性消失。成本变成机器的成本,是固定的。响应以毫秒计。数据不出你的内网。
为什么是 300 亿参数,而不是 5000 亿
我来翻译一下这个数字。参数大致相当于模型的"脑容量"。云端那些巨型模型有几千亿。一个 300 亿参数的模型,能塞进一块 24 GB 左右的显卡。一台这样的电脑,视配置在 1.5 万到 3 万雷亚尔之间。
明显的问题来了:小模型不是更差吗?
是更差。在复杂推理、长文分析、高难度代码上,大模型轻松取胜。但你看看企业里的自动化,一整天真正在做什么:
- 读一封邮件,判断它是报价、售后还是垃圾邮件
- 从发票 PDF 里提取税号、金额和到期日
- 检查填好的表单有没有缺项
- 条件满足时触发下一步
这些任务没有一个需要天才。需要的是稳定和随叫随到。这是勤快实习生的活,不是资深顾问的活。为这种事动用顶配模型,就像请一位税务律师来核对账单上有没有条形码。
好的自动化不是最聪明的那个,而是从来不用请示就能跑的那个。
混合模式,这才是真正跑得通的地方
这里说一个我很坚定的看法:几乎没有人应该在本地和云端之间二选一。正确答案是两个都用,再定一条规则,谁负责什么。
实际操作里,我是这样搭的:
本地智能体全天待命。它观察、过滤、分类、执行例行事务。一天 24 小时运行,跑着和闲着花的钱一样多。
出现不符合常规的情况时,它就上报。只把那一个案子发给云端的大模型,让它解决难题再返回。
数字很好看。在我搭的一个邮件分拣流程里,91% 的消息在本地就解决了。只有 9% 上云。API 账单从 1100 降到每月 130 雷亚尔左右。本地机器五个月回本,之后就是净赚。
还有一个谁都没预料到的副作用:系统变得更可靠了。某个周二云端 API 挂掉的时候,本地智能体还在继续分拣。只有复杂案子的队列停了。生意没停。
什么情况下不值得
我不卖神话。本地智能体在三种情况下表现很差。
用量低。 如果你的自动化一天跑 50 次,API 一个月花你 8 雷亚尔。为了省 8 块钱去买一台 2 万的机器,这种决定只适合当酒桌笑话。
没有技术团队。 本地意味着得有人管。更新、监控、卡住了要重启。如果没有这个人,也没有能代劳的合作方,那云端说实话更好。它坏得更少,而且坏了是别人的事。
必须用最强模型的任务。 长合同的法律分析、复杂代码生成、多步串联推理。在这里小模型会出错,而自动化里的错误比 token 贵得多。
我用的实用标准是:如果你每月 AI 账单超过 500 雷亚尔,并且超过 70% 的调用是重复性任务,那就值得研究。低于这个线,留在云端,安心睡觉。
怎么不花一分钱先测一测
本地 AI 智能体最好的一点是,在投入之前可以免费试。
第一步,看你的用量日志。大多数平台都会显示你调用了多少次、每次花了多少。分个类:有多少是简单又重复的任务?
第二步,在一台还过得去的笔记本上装一个开源模型。Ollama 或者 LM Studio 这类工具,两次点击、十五分钟就能搞定。70 到 80 亿参数的小模型,16 GB 的 Mac 都能跑。
第三步,拿一百个真实走过你流程的案例。正确答案你已经知道了。本地和云端各跑一遍,然后对比。
如果本地在简单任务上正确率达到 90% 以上,你的场景成立。如果只有 60%,那你在一台笔记本上就省下了买机器的钱。
这个测试一天就够。不需要立项,不需要委员会,也不需要一份带四种情景的 PPT。
我真正的看法
Muse Glimmer 这类模型指向一个方向,我早就在讲:AI 正在变成基础设施,而不是服务。
服务你租。基础设施你装。没有人按次为查数据库付费,也没有人按请求为访问自己的文件服务器付费。到了某个时候,"我付了三分钱让 AI 读一封邮件"听起来会跟按分钟付拨号上网费一样奇怪。
这不会杀死云端。它杀死的是"云端是一切问题的默认答案"。剩下的是一个架构选择,拿着数字来做:例行的放在近处,困难的送去远方。
接下来这部分才是跟你生意有关的。这个选择不是技术问题,是成本和风险问题。你今天花多少钱,其中多少是重复劳动,如果 API 在周五下午挂掉会发生什么,哪些数据你希望永远不要离开这里。开发能回答技术那一问。另外四问要你自己回答。
如果你答不上来花了多少、花在哪,那这就是第一件要做的事。在买机器之前,在选模型之前,在一切之前。测量很无聊,但它是最省钱的那一步。
想聊聊在你那边什么值得自动化,告诉我什么在占用你的时间。
LinkedIn 摘要
一个客户的 AI 账单,六周内从 90 雷亚尔涨到了 1100 雷亚尔。没有任何东西出故障。 只是智能体开始全天候运行:读邮件、给订单分类、更新表格。每次检查几分钱,一天 4000 次检查。 一个不太好听的事实:这些任务里有 90% 不需要天才,只需要稳定。这是勤快实习生的活,不是资深顾问的活。 我让一个本地模型全天待命,负责所有例行任务,只把难啃的случай交给云端。91% 在本机就解决了,账单回到每月 130 雷亚尔。 还有一个谁都没料到的附赠好处:某个周二 API 挂掉的时候,本地智能体还在继续分拣。生意没停。 在买机器或者选模型之前,先量一量。你现在花了多少钱,其中有多少纯粹是重复劳动? 告诉我什么在占用你的时间,我来判断值不值得自动化。 #人工智能 #自动化 #科技 #管理 #AI