本地 AI 智能体:14MB,断网也能跑
你有没有收到 AI 接口账单的时候心想“我不就是拿它给邮件分类吗”?是啊。企业用 AI 做的事,大部分都是小的、重复的、无聊的任务。而我们一直在用坐火箭的价钱去楼下买面包。正因为如此,本地 AI 智能体,也就是那些能在设备上直接运行的超小模型,开始成为一个正经话题。
这周出现了一个叫 Needle2 的模型,来自 Cactus Compute。它占用 14 兆字节。没有打错字。十四。你手机里一张照片都比它大。而且它不是聊天机器人:它是一个专门用来调用工具的模型,也就是决定执行哪个动作、带哪些参数。它能跑在手机上、手表上、智能门锁上、仓库机器人上。
当 AI 装得进设备,会有什么变化
现在的标准做法是:你的应用发出请求,送到云端,等待,接收,展示。这样也能用。但它带着三个开会时谁都不太想面对的问题。
第一,成本。你按 token 付费,而 token 是变动开销。产品越成功,账单越贵。这是世界上唯一一门成功会惩罚你的生意。
第二,延迟。往返云端要花 300 毫秒到 2 秒,看客户的网络情况。写一段文字,没问题。但让一把门锁决定要不要开门,这就是一个世纪那么久。
第三,数据。每次文本离开你的机器,就得有人在审计时回答它去了哪里、被怎么处理。我见过医疗项目卡在这个问题上两个月。
本地模型一次解决这三件事。应用装好之后,每次调用成本为零。响应在几十毫秒内完成。数据永远不离开设备,关于数据合规的对话会短很多。
不是每个任务都需要天才。很多事只需要一个不会按错按钮的人。
可是 14MB 能“想”什么吗
不能,而这正是重点。这么大的模型不会写你的商务方案,不会分析合同,也不会取代你真正干活时用的 Claude 或 GPT。你要它做市场分析,它会编。而且编得很自信。
它只做一件事,并且做得好:把一句话变成结构化的动作。
- “关掉客厅的灯”变成
灯.关闭(房间="客厅") - “周二下午两点跟保罗约个会”变成一次日程调用,字段都填好
- “客户投诉账单收错了”变成一张分类正确的工单
这是智能路由。把人话翻译成机器指令。大多数自动化需要的,大概 70% 就是这个,而我们一直用几十亿参数的模型去干这活。
诚实的类比:这是聘请资深律师和聘请一位非常好的前台之间的区别。你不会让资深律师去转接电话。
这东西在真实业务里用在哪
我把它从抽象里拿出来。三个我这边经常遇到的场景。
外勤应用。 维修技师、配送员、外访销售。这些人在仓库、地下室、公路上工作,4G 信号常常没有。现在他们的应用要么是一堆难填的表单,要么得靠网络才能“理解”他们输入了什么。用本地模型,人只要说“我换了压缩机,配件 4402,客户已签字”,应用就把报告填好。没有信号也行。之后再同步。
消息分流。 一家公司每天在 WhatsApp 上收到 300 条消息。通过接口给每条分类(报价、支持、投诉、垃圾信息)单价很低,但也是钱。而且每条消息都会经过第三方服务器。在自己服务器上跑一个小模型做分流,只有复杂的才往上送给大模型。
实体设备。 自助终端、闸机、控制面板、工业设备。这里没什么好争的:如果决策依赖云端,而云端挂了,设备就成了摆设。
注意这个共同点。这三个场景里,纯粹的智能都不是瓶颈。瓶颈是成本、连接或隐私。
比模型本身更值钱的那个诀窍
下面这部分才是真正有用的,而且不管 Needle2 存不存在都成立。
有效的架构是分层的。小模型在前,大模型在后。小模型接住所有进来的请求,简单的自己解决,难的往后传。这跟一个好的人工客服完全一样:一线和二线。
在实际的支持流程里,大概 60% 到 80% 的输入是重复的。补开账单、营业时间、订单状态、修改资料。如果本地模型把这一段接住,你的接口账单就按同样比例下降。质量不会掉,因为难的仍然交给好模型。
我在客户那里实现过这个逻辑,甚至没用本地模型:只是在 AI 前面加了一层规则过滤。第一个月账单降了 40%。前面放一个小模型,砍掉的更多,而且过滤更聪明,因为它能理解写法的变化(“账单”“帐单”“那张要付钱的纸”)。
结论不是“用超小模型”。而是:别把所有东西都丢给最贵的那个模型。在 AI 领域,这相当于每天叫豪华专车去街角,然后回头抱怨账单。
现阶段我还不会拿它做的事
既然聊到这儿,说一个明确的看法:涉及金钱、健康或人身安全的事情,我不会让一个 14MB 的模型独自做决定。不是因为它差,而是因为小模型的错误率更高,你得有一套它出错时的方案。
正确的用法是留后路。模型不确定的时候,它不瞎猜:它升级。交给大模型,或者交给人。一个实现得好的“我不知道”,比十个百分点的准确率更值钱。
同样,把它塞进一个还不存在的产品里也不值。如果你的流程还没理清楚,先上本地 AI 就是在优化一个你还不知道有没有人会用的东西。先用又贵又简单的方式让它跑起来。之后拿着真实数据再降本。
不花钱怎么开始
一条短路径,按顺序来:
- 从你的客服或应用里取 200 条真实交互。别编,用真的。
- 分成两堆:“标准答复就能解决”和“需要动脑子”。
- 如果第一堆超过 100 条,你有一个明确的场景。如果只有 20 条,就别折腾了,去做别的事。
- 算一算第一堆今天花了多少:接口费、人的时间、客户等待。
这个数字就是你的预算。如果它很小,很好,你刚刚省掉了一个项目。如果它很大,那你现在很清楚自己在买什么。
Needle2 和这类模型有意思的地方不在于尺寸。而在于它带出的信息:行业花了两年追更大的模型,现在才发现很多公司的问题恰恰相反。不是缺智能。是没把合适的智能,用合适的成本,放到合适的位置。
如果你的业务什么都往 AI 上送,又怀疑自己在简单任务上花了太多钱,这通常一个下午就能量出来。跟我说说你在自动化什么,我们看看这笔省钱是真的存在,还是只是漂亮的理论。
LinkedIn 摘要
你的 AI 账单又涨了,而其中很大一部分只是用来给邮件分类。 这周出现了 Needle2,一个只有 14 兆字节的模型,直接在设备上运行,不需要联网。它不思考,不分析合同,也不写方案。它只做一件事:把一句话变成一个动作。 说实话,我看到的自动化里大概有 70% 需要的正是这个,但它们跑在几十亿参数的模型上。 这笔账跟模型大小无关。它关乎的是:别再每天叫豪华专车去街角,然后回头抱怨账单。 小模型在前,大模型在后,遇到不确定的就往上升级,而不是瞎猜。我见过光是在 AI 前面加一层规则过滤,成本就降了 40%。 如果你怀疑自己在简单任务上花了太多钱,这件事一个下午就能量出来。跟我说说你在自动化什么。 #人工智能 #本地AI #边缘计算 #自动化 #科技