本地 AI:在你公司内部运行的 AI 智能体
你打开 AI API 的账单,被吓了一跳。三千雷亚尔,而那个月没人刻意"用过 AI"。是那个半夜跑着给邮件分类的小机器人,是那个总结工单的脚本,是那个每十分钟检查一次订单的流程。每次调用只要几分钱。几分钱乘以十万次调用,就变成了一份工资。正是在这个时候,本地 AI 开始变得有意义:一个更小的模型,跑在你自己的机器上,整天开着,没有计费器在转。
Meta 在六月发布了 Muse Glimmer,一个 300 亿参数的开源模型,就是为这件事做的:在你自己的基础设施上、一直保持在线的智能体。它不是世界上最聪明的模型。它也不需要是。它是为另一件事做的。
"一直在线"在实际中是什么意思
企业里的 AI 用法有两种,人们经常把它们混在一起。
第一种是零星使用。有人要一段文案、一份分析、一个方案。一天发生十次、二十次。它需要做得好。因为量小,所以花不了多少钱。
第二种是后台使用。那个读取每一封进来的邮件、判断它是询价、投诉还是垃圾邮件的智能体。那个监控库存的。那个把销售的每通电话都转写并总结的。这些东西一直在跑,没人盯着,而且和第一种比起来,量大得离谱。
常见的错误是两边都用贵模型。这就像请一位资深律师来盖章。能用,但你在按律师的时薪付钱去盖纸。
大模型用来思考。小模型用来干活。
为什么 300 亿参数的模型改变了这笔账
三百亿参数听起来很多。在 2023 年,这是数据中心的事。今天,它可以跑在一块 24 GB 左右的显卡上,就是那种建筑设计工作室的渲染机里已经有的显卡。
这一下改变了三件事。
成本变成固定的。 你买下或者租下机器,就结束了。那个月智能体跑了一千次还是一百万次,都无所谓。我有个客户有一个给 WhatsApp 消息分类的流程:每月大约 4 万条。放在云端,接近 900 雷亚尔。迁移到一台每月 400 雷亚尔的带 GPU 的 VPS 上跑本地模型后,还有余量再加三个自动化,价格不用动。
数据不出门。 会计事务所、诊所、律所。如果智能体要读客户的文件,总会有人问这份文件去了哪里。"留在公司的服务器里",这个回答比一整段关于境外供应商数据留存政策的说明好讲太多了。
延迟消失了。 不用跑到另一个大洲的服务器上再回来。响应永远在一秒以内。对于一个任务要走二十步的智能体来说,这是两秒和三十秒的区别。
本地 AI 不适合的地方
我说实话,因为这部分几乎没人写。
小模型在开放性任务上错得更多。如果你说"分析这份合同,告诉我风险在哪里",它会给你一个看起来合理的回答,你会以为一切都好。其实不好。在这类任务上,它和大模型的差距非常大,而且往往等你发现的时候已经很晚,代价很高。
本地模型脑子里也没有最近几个月的互联网。它不知道上周改了什么法律。它需要接入你的数据才有用,而这是集成的工作,不是魔法。
还有一件显而易见的事:得有人照看这台机器。如果你公司没有人会搭服务器,而它在某个周六挂掉了,那你只是把一张账单换成了一个麻烦。
我用的判断规则很简单。如果任务是重复的、格式清晰的,偶尔出错也不会造成什么后果,那就用本地。如果任务是开放的、罕见的,而且出错代价很高,那就用好模型,付那几分钱。
一个可以照着抄的例子
一家零件经销商,销售部门六个人。每天通过邮件和 WhatsApp 进来大约 300 个订单,全是自由文本:"上个月买的那个滤芯,给我发 20 个"。
以前的流程是一个人读消息,然后手动录入 ERP。这个人每天要花四个小时。
我们搭的东西是这样的:
- 一个本地智能体读消息,提取三样东西:客户、产品、数量。
- 它去数据库查这个客户的历史记录,来解决"那个滤芯"是哪个。
- 如果置信度高,就在 ERP 里创建订单草稿。
- 如果有任何疑问,就丢进人工队列,并把它已经理解的部分先填好。
没有什么"自主 AI"。这个智能体就是一个手脚很快的实习生,负责填表,不确定的时候举手。大约 70% 的订单不用人工碰。剩下 30% 送到人手上时已经填了一半,所以连这部分也变快了。
这个任务无聊、重复、结构清晰。300 亿参数的模型绰绰有余。而且因为跑在本地,没人在数 API 调用次数。
怎么在不烧钱的情况下试一试
别买 GPU。真的。这是经典的错误:老板一激动,花一万五买了台机器,然后它变成了摆设。
按这个顺序来:
- 只挑一个任务。 挑你手上最重复的那个。如果你没办法用两句话说清楚这个智能体要决定什么,那它还没准备好。
- 先在云端跑,用好模型。 跑两周。它很贵,而正是这张账单会告诉你值不值得迁移。这也是你判断这个任务本身行不行的方式。
- 量一下准确率。 和人做的结果比。如果人做对 97%,AI 做对 91%,你要判断这个差距疼不疼。有时候疼。有时候完全无所谓。
- 然后才去测本地。 按月租一台带 GPU 的机器,跑同一套测试,比较数字。如果掉得太多,就退回去。
- 如果连着三个月都表现不错,那时候再考虑买硬件。
这条路只要花几百雷亚尔,就能知道这个想法靠不靠谱。这比事后才发现便宜太多了。
对你真正重要的那一点
值得注意的消息不是"又出了一个模型"。每周都有新模型出来,六个月后 Muse Glimmer 就旧了。
重点在于,做日常自动化所需要的质量,已经不再是那些跟云巨头签合同的人的专属了。今天,一个只有一名开发者的工作室就能搭出一个跑在客户基础设施上的智能体,数据不出客户的门,每月成本固定,一家十个人的公司也负担得起。
这改变了值得问的问题的类型。不再是"这个 AI 每月要花多少钱"。而是"我的业务里,哪个任务重复到足以让一个智能体专门去管它"。
如果你心里已经有一个任务,想听一个关于它值不值得自动化的坦诚意见,来找我聊聊。有一半的时候我的回答是现在还不值得,而这同样是有用的信息。
LinkedIn 摘要
有人发给我一张 AI API 账单的截图:那个月没人刻意"用 AI",却花了 3000 雷亚尔。 是一个小机器人在半夜给邮件分类。每次调用几分钱,十万次调用,就是一份工资。 错的不是 AI。错的是用贵模型干笨活。就像请资深律师去盖章。 大模型用来思考。小模型用来干活。而今天,一个小模型可以跑在你自己的机器上,用你自己的数据,成本固定。 在一家零件经销商那里,70% 的订单不用人工碰就进了 ERP。每月成本:机器的租金,就这些。 如果你心里已经有一个重复性的任务,想知道值不值得自动化,来找我聊。有一半的时候我会说现在还不值得,这也是一个答案。 #人工智能 #自动化 #本地AI #中小企业 #科技