返回博客
人工智能智能体自动化

本地 AI 智能体:14MB,断网也能跑

2026年9月06日·7 分钟阅读·Diego Horvatti

你有没有收到 AI 接口账单的时候心想“我不就是拿它给邮件分类吗”?是啊。企业用 AI 做的事,大部分都是小的、重复的、无聊的任务。而我们一直在用坐火箭的价钱去楼下买面包。正因为如此,本地 AI 智能体,也就是那些能在设备上直接运行的超小模型,开始成为一个正经话题。

这周出现了一个叫 Needle2 的模型,来自 Cactus Compute。它占用 14 兆字节。没有打错字。十四。你手机里一张照片都比它大。而且它不是聊天机器人:它是一个专门用来调用工具的模型,也就是决定执行哪个动作、带哪些参数。它能跑在手机上、手表上、智能门锁上、仓库机器人上。

当 AI 装得进设备,会有什么变化

现在的标准做法是:你的应用发出请求,送到云端,等待,接收,展示。这样也能用。但它带着三个开会时谁都不太想面对的问题。

第一,成本。你按 token 付费,而 token 是变动开销。产品越成功,账单越贵。这是世界上唯一一门成功会惩罚你的生意。

第二,延迟。往返云端要花 300 毫秒到 2 秒,看客户的网络情况。写一段文字,没问题。但让一把门锁决定要不要开门,这就是一个世纪那么久。

第三,数据。每次文本离开你的机器,就得有人在审计时回答它去了哪里、被怎么处理。我见过医疗项目卡在这个问题上两个月。

本地模型一次解决这三件事。应用装好之后,每次调用成本为零。响应在几十毫秒内完成。数据永远不离开设备,关于数据合规的对话会短很多。

不是每个任务都需要天才。很多事只需要一个不会按错按钮的人。

可是 14MB 能“想”什么吗

不能,而这正是重点。这么大的模型不会写你的商务方案,不会分析合同,也不会取代你真正干活时用的 Claude 或 GPT。你要它做市场分析,它会编。而且编得很自信。

它只做一件事,并且做得好:把一句话变成结构化的动作。

  • “关掉客厅的灯”变成 灯.关闭(房间="客厅")
  • “周二下午两点跟保罗约个会”变成一次日程调用,字段都填好
  • “客户投诉账单收错了”变成一张分类正确的工单

这是智能路由。把人话翻译成机器指令。大多数自动化需要的,大概 70% 就是这个,而我们一直用几十亿参数的模型去干这活。

诚实的类比:这是聘请资深律师和聘请一位非常好的前台之间的区别。你不会让资深律师去转接电话。

这东西在真实业务里用在哪

我把它从抽象里拿出来。三个我这边经常遇到的场景。

外勤应用。 维修技师、配送员、外访销售。这些人在仓库、地下室、公路上工作,4G 信号常常没有。现在他们的应用要么是一堆难填的表单,要么得靠网络才能“理解”他们输入了什么。用本地模型,人只要说“我换了压缩机,配件 4402,客户已签字”,应用就把报告填好。没有信号也行。之后再同步。

消息分流。 一家公司每天在 WhatsApp 上收到 300 条消息。通过接口给每条分类(报价、支持、投诉、垃圾信息)单价很低,但也是钱。而且每条消息都会经过第三方服务器。在自己服务器上跑一个小模型做分流,只有复杂的才往上送给大模型。

实体设备。 自助终端、闸机、控制面板、工业设备。这里没什么好争的:如果决策依赖云端,而云端挂了,设备就成了摆设。

注意这个共同点。这三个场景里,纯粹的智能都不是瓶颈。瓶颈是成本、连接或隐私。

比模型本身更值钱的那个诀窍

下面这部分才是真正有用的,而且不管 Needle2 存不存在都成立。

有效的架构是分层的。小模型在前,大模型在后。小模型接住所有进来的请求,简单的自己解决,难的往后传。这跟一个好的人工客服完全一样:一线和二线。

在实际的支持流程里,大概 60% 到 80% 的输入是重复的。补开账单、营业时间、订单状态、修改资料。如果本地模型把这一段接住,你的接口账单就按同样比例下降。质量不会掉,因为难的仍然交给好模型。

我在客户那里实现过这个逻辑,甚至没用本地模型:只是在 AI 前面加了一层规则过滤。第一个月账单降了 40%。前面放一个小模型,砍掉的更多,而且过滤更聪明,因为它能理解写法的变化(“账单”“帐单”“那张要付钱的纸”)。

结论不是“用超小模型”。而是:别把所有东西都丢给最贵的那个模型。在 AI 领域,这相当于每天叫豪华专车去街角,然后回头抱怨账单。

现阶段我还不会拿它做的事

既然聊到这儿,说一个明确的看法:涉及金钱、健康或人身安全的事情,我不会让一个 14MB 的模型独自做决定。不是因为它差,而是因为小模型的错误率更高,你得有一套它出错时的方案。

正确的用法是留后路。模型不确定的时候,它不瞎猜:它升级。交给大模型,或者交给人。一个实现得好的“我不知道”,比十个百分点的准确率更值钱。

同样,把它塞进一个还不存在的产品里也不值。如果你的流程还没理清楚,先上本地 AI 就是在优化一个你还不知道有没有人会用的东西。先用又贵又简单的方式让它跑起来。之后拿着真实数据再降本。

不花钱怎么开始

一条短路径,按顺序来:

  1. 从你的客服或应用里取 200 条真实交互。别编,用真的。
  2. 分成两堆:“标准答复就能解决”和“需要动脑子”。
  3. 如果第一堆超过 100 条,你有一个明确的场景。如果只有 20 条,就别折腾了,去做别的事。
  4. 算一算第一堆今天花了多少:接口费、人的时间、客户等待。

这个数字就是你的预算。如果它很小,很好,你刚刚省掉了一个项目。如果它很大,那你现在很清楚自己在买什么。

Needle2 和这类模型有意思的地方不在于尺寸。而在于它带出的信息:行业花了两年追更大的模型,现在才发现很多公司的问题恰恰相反。不是缺智能。是没把合适的智能,用合适的成本,放到合适的位置。

如果你的业务什么都往 AI 上送,又怀疑自己在简单任务上花了太多钱,这通常一个下午就能量出来。跟我说说你在自动化什么,我们看看这笔省钱是真的存在,还是只是漂亮的理论。

LinkedIn 摘要

你的 AI 账单又涨了,而其中很大一部分只是用来给邮件分类。

这周出现了 Needle2,一个只有 14 兆字节的模型,直接在设备上运行,不需要联网。它不思考,不分析合同,也不写方案。它只做一件事:把一句话变成一个动作。

说实话,我看到的自动化里大概有 70% 需要的正是这个,但它们跑在几十亿参数的模型上。

这笔账跟模型大小无关。它关乎的是:别再每天叫豪华专车去街角,然后回头抱怨账单。

小模型在前,大模型在后,遇到不确定的就往上升级,而不是瞎猜。我见过光是在 AI 前面加一层规则过滤,成本就降了 40%。

如果你怀疑自己在简单任务上花了太多钱,这件事一个下午就能量出来。跟我说说你在自动化什么。

#人工智能 #本地AI #边缘计算 #自动化 #科技