AI 智能体:为什么把任务拆小才有效
你让 AI「把公司的报价流程组织起来」,结果拿回一个十二步的怪物,没人看得懂。然后你去测,在三个不同的地方出了错,现在你不知道该修哪一部分。这是今天 AI 智能体最常见的问题,而它几乎从来不是模型的锅。是请求太大的锅。
我每周都在客户项目里看到这种情况。人们用的工具没有错。他们交出去的请求太大了,大到没有谁能一次做对,人或机器都一样。
为什么 AI 智能体在大任务上会出错
想象一个新员工的第一天。你说:「负责财务。」他会做点什么。多半是错的。不是因为他笨,而是因为「负责财务」不是一条指令,是一个愿望。
AI 智能体也一样,还多了一个麻烦:它们从不说「我没听懂」。它们总会交付。而且很自信。哪怕是在编。
还有数学的那一面,这部分没人讲。如果一个任务的每一步有 95% 的概率做对,任务有 10 步,那全部做对的概率是 0.95 的 10 次方。等于 60%。20 步的话,降到 36%。
也就是说:一个在单步上几乎总能做对的 AI,当你串起太多步骤时,大多数时候都会出错。不是模型变差了。是算出来的。
AI 智能体不是因为笨才失败。是因为收到的请求太大,大到没有谁能一次做对。
把工作拆成小块之后会发生什么
我举一个具体的例子,来自一个做楼宇维护的客户。
原始的请求是:「做一个智能体,接收客户在 WhatsApp 上的报修并解决它。」而「解决」里面包含:理解问题、判断紧急程度、检查客户合同是否有效、看哪个技师有空、安排时间、通知客户、在系统里登记。
七件事。第一版大概在 40% 的报修上能跑通。剩下的 60% 里,派错技师,或者给欠费客户安排上门,或者干脆不回复。
我们把它拆成三个独立的步骤,每一步都有明确的输入和输出:
- 第 1 步: 读消息,返回一份结构化的摘要(问题类型、地址、紧急程度 1 到 3)。就这些。
- 第 2 步: 拿着这份摘要,查合同和排班。返回一个可选时间的列表,或者一个做不了的理由。
- 第 3 步: 和客户确认并登记。
每一步都变成一个小请求,配一个可以核对的回答。如果第 1 步把紧急程度判错了,你当场就能在摘要里看到,在任何技师被派出去之前。
改动之后的成功率:89% 的报修无需人工介入就能走完。剩下的 11% 停在失败的那一步,错误看得见,有人两分钟就能处理掉。
收益不是来自更好的模型。是同一个模型收到了它能完成的请求。
怎么判断你的任务是不是太大了
有一个简单的测试。把你希望智能体做的事写下来。然后数一数它需要做多少个决定。
超过两三个,就太大了。拆。
另一个测试更直接:你能看一眼输出,五秒内说出它对还是错吗?如果答案是「我得查一下」,那这块就太大了。好的输出是当场就能核对的。
你已经越界的信号:
- 指令里出现了两次以上的「然后」。
- 你没法用一句话描述期望的结果。
- 出错的时候,你不知道是从哪里开始错的。
- 你已经把请求重写了四遍,每一版都在一个新的地方崩掉。
最后这条最阴险。你一直在调请求的措辞,以为是用词的问题。不是。是结构的问题。
在你的业务里落地的步骤
不需要新工具。需要方法。这样做:
1. 把流程按今天真人怎么做的写下来。 先别想 AI。只写真实的步骤。谁做什么,按什么顺序,手上有哪些信息。
2. 标出哪里需要有人做决定。 每一个决定都是一条天然的边界。就在那里切。
3. 定义每一块的输入和输出。 这是最重要的,也是最多人跳过的。「输入:客户消息。输出:包含类型、地址和紧急程度的 JSON。」具体。可核对。
4. 只自动化一块。 最好挑最烦最重复的那块。跑两周,有人盯着。
5. 然后才接上下一块。 依此类推。
第五步是几乎所有人都会翻车的地方。一次性全部接上的诱惑很大,尤其是在第一块跑得漂亮之后。忍住。当第 1 到 3 步都已经跑完,才在第 4 步发现错误,那个代价远比多等两周的耐心要大。
「那这样不就失去 AI 的魔法了吗?」
这个反对意见总会出现,而且有它的道理。外面卖的承诺恰恰相反:说出你要什么,AI 全都自己搞定。
只是实际上你要的不是魔法。你要的是可预测性。魔法在演示视频里很棒,在周二早上客户打电话来问技师为什么没到的时候很糟糕。
拆成小块,你失去的是:拥有一个机器人管家的感觉。
你得到的是:停下来的时候确切知道停在哪,可以换掉一步而不动其他步,还能向团队解释这东西是怎么运作的。
还有一个实际的成本优势。小任务每次调用消耗的算力更少,也让你能在不需要多余智能的地方用更便宜的模型。判断报修的紧急程度不需要市面上最贵的模型。写商业提案也许需要。当所有东西都是一整块的时候,你在每一部分上都在付最难那部分的价钱。
没人喜欢听的那一段
把工作拆开,一开始更费劲。要花更多时间梳理流程,要更多讨论每一步到底返回什么,第一周里「看这多酷」的时刻更少。
作为交换,业务不再靠运气。
我宁可交付一个把三件事做好、在第四件上清楚地停下来的智能体,也不要一个承诺七件、做对四件却不说是哪四件的。后者在会议上更唬人。前者是六个月后还在跑的那个。
这就是自动化和自动化表演的区别:后者在演示里管用,前者在你没看着的时候管用。
如果你有一个重复的流程,手动做到已经厌烦了,想评估从哪里开始拆,告诉我你今天是怎么做的。我通常会给一个诚实的看法,关于什么值得自动化,什么不值得。
LinkedIn 摘要
你让 AI「把整个流程组织起来」,结果拿回一个十二步的怪物,在三个不同的地方崩掉。 问题几乎从来不在模型。在于请求的大小。 如果每一步有 95% 的成功率,任务有 10 步,全部做对的概率是 60%。20 步的话,降到 36%。不是 AI 变差了,是算出来的。 在一个做楼宇维护的客户那里,我们把一个 7 步的智能体拆成 3 个小块,每一块都有可核对的输入和输出。成功率从 40% 提到了 89%。同样的模型,更小的请求。 快速自测:如果你看一眼输出,5 秒内说不出它对不对,那这块就太大了。 你有没有一个重复的流程,手动做到已经厌烦了?告诉我是什么,我给你一个关于哪些值得自动化的诚实看法。 #人工智能 #自动化 #AI智能体 #生产力 #科技