AI 智能体:瓶颈不在生成,在审核
你让 AI 生成目录里 300 个产品的描述。它四分钟就交货了。然后你卡住了。因为现在得有人把这 300 条读完,而读 300 条描述比手写 50 条还要花时间。瓶颈换了位置,却没人提醒你。
这就是 AI 智能体在企业里那个没人说破的问题。生产这一段变便宜了。核对这一段还是照样贵,代价一分没变:你的注意力。而注意力不会因为一个月费订阅就扩容。
我看到一位美国开发者 Daniel Vaughn 在编程的语境下写过这件事。他的观点是:审核 AI 生成的代码体验很差,因为文本这种格式是为人类书写设计的,不是为人类大批量审计设计的。这个结论远不止适用于代码:当机器开始规模化产出,交付的格式就必须跟着变。否则你自己就成了那个漏斗。
当生产变成免费,什么改变了
以前,成本在执行上。做报价、写邮件、整表格、回客户。你雇人来执行,控制靠抽查,因为量本来就是人的量。
现在执行只要几分钱。你吃个午饭的工夫,一个智能体回完了 400 封邮件。可是控制还是人在做,而量已经不是人的量了。
我在企业里看到的实际结果,永远是这三种之一:
- 人把所有东西都审一遍,被淹没,省下来的时间就这么蒸发了。
- 人干脆不审了,三周后才发现智能体一直在向客户承诺 24 小时送达,而那个城市物流实际要跑五天。
- 人放弃 AI,退回老办法,一口咬定“这玩意儿没用”。
这三种都不是 AI 的错。是自动化了生产,却没有重新设计核对环节。
自动化了执行却不重新设计控制,等于把一个已知的瓶颈换成一个看不见的瓶颈。
为什么审核比看起来贵得多
审核不等于阅读。审核是读完、理解意图、和应该的样子做对比、再做决定。每一条要走四道心智工序。
我跟客户常做一个测试:给十条 AI 生成的内容计时审核。几乎每次都落在每条 40 秒到 2 分钟之间,看复杂度。拿 2 分钟乘以 300,是十个小时。而生成只花了四分钟。
还有一个更狠的细节。AI 写出来的文字,给人一种“它是对的”的感觉。它流畅、标点工整、语气笃定。这会关掉你的雷达。实习生写了句怪话,你立刻就察觉到。AI 用十足的自信写错一件事,你读完还点头。错误被包装在专业感里。
出路不是审得更好,是审得更少
所有人的第一反应都是想加快审核。读快一点、再招个人帮忙、抽查 10%。这都是打补丁。
真正有效的是改变智能体交付的东西。你要的不只是最终成品,而是成品加上一套能让你快速核对的结构。有三件事特别管用:
1. 要它交出决策摘要,不只是结果。 如果智能体给 500 个工单做了分类,它还应该回报:“我归成 6 类,其中 480 个落在 3 类里,另外 20 个不确定,列在这里”。你审那 20 个。那 480 个抽样核对。你的注意力去到真正不确定的地方。
2. 让智能体标注自己的把握程度。 让它把有扎实依据做出的判断,和靠猜的判断分开。你明确提出要求时,现在的模型做得还算不错。不完美,但它把一堆均质的东西变成了有优先级的一堆。
3. 把验证放在便宜的地方。 如果智能体生成价格,就用一段脚本在任何人看到之前先检查数值是否落在区间内。如果它生成配送时效,就用一条规则去比对物流公司的真实时效表。固定规则不会累、不会错,毫秒级跑完。把人脑只留给真正需要判断的部分。
一个真实案例
我有个客户是经销商,每天在 WhatsApp 上收大约 200 个订单,全是散文式的文字。类似“发 3 箱 40 号的,2 箱 25 号的,跟上周那张单一样”。两个人整个上午都在把这些变成系统里的订单。
自动化的第一版很笨:智能体读消息,然后建订单。85% 的情况下能跑通。听起来很棒。并不是。200 的 15% 就是每天有 30 个错单进系统,而且没人知道是哪 30 个。那两个人只好把全部 200 个都核一遍,就为了找出那 30 个。反而更糟了。
第二版改了交付方式。智能体开始返回解析后的订单,外加一个状态:所有编码都对上了资料库、而且客户有该商品的历史记录,标绿;有猜测成分的,标黄;信息缺失的,标红。绿的直接进系统。黄的和红的进一个队列,原始消息和解析结果并排放在一起,五秒钟就能核完。
绿色大概占了 70%。那两个人从看 200 个变成看 60 个,而且是真的在看,屏幕上带着上下文。整整一个上午的活变成了一小时。真正解决问题的不是更强的模型。是智能体开始把自己的推理过程亮出来。
“这不就是不信任 AI 吗?”
是不信任流程,这不一样。你也不会让一个新员工,不管他多优秀,第一个月就单独批付款。这不是人身攻击,这是流程设计。
这里还有一个很多人忽略的商业要点。责任始终是你的。如果智能体向客户承诺了一个时效而你没做到,客户不会接受“是 AI 干的”。如果它在 200 笔销售里算错了折扣,亏的是你的现金。AI 没有营业执照。你有。
这不是踩刹车的理由。这是把它搭对的理由。带着合理核查点的自动化,比没有核查点的更快,因为没有核查的那种迟早会出事,然后你得全线停下来查原因。
怎么开始,又不变成一个六个月的项目
只挑一个流程。最好是那种枯燥、重复、风险低的。谁也不该拿工资核算来给自动化开张。
然后在动手写任何东西之前,先问三个问题:
- 这个流程今天出错的时候,有人是怎么发现的?如果答案是“发现不了”,先把这个解决掉。
- 这里最贵的错误是什么,它能不能用一条固定规则拦住?
- 有多少量明显只是例行公事,多少需要判断?这个比例就是你真正的收益。
跟老办法并行跑两周。做对比。你几乎每次都会发现,智能体在某一类情况上做得很准,在另一类上系统性地出错,这时候决定就好做了:第一类自动化,第二类留给人。
AI 智能体真正难的部分,从来不是让它跑起来。而是让你在打开开关之后还能睡得着。这一点不来自模型,来自它周围的设计。
如果你有一个已经在自动运行、但没人真正信得过结果的流程,或者你想搭一个、又不想掉进审核瓶颈这个坑,来跟我聊聊你的情况。通常一次对话我就能告诉你值不值得做。
LinkedIn 摘要
AI 用 4 分钟写了 300 条产品描述。然后公司卡住了。 因为现在得有人把这 300 条读完。读 300 条比手写 50 条还要花时间。 瓶颈没有消失,只是换了位置。生产变便宜了。核对还是在消耗你的注意力,而注意力不会因为一个月费订阅就扩容。 我有个客户,每天在 WhatsApp 上收 200 个订单。第一版自动化的准确率是 85%,但没人知道错的那 15% 是哪些。反而更糟了。第二版开始给每个订单标上绿、黄、红三种状态。绿色直接进系统。整整一个上午的活变成了一小时。 真正解决问题的不是更强的模型。是让智能体把自己的推理过程亮出来。 如果你有一套正在跑、但没人真正信得过的自动化,来找我聊聊你的情况。 #人工智能 #流程自动化 #管理 #科技 #生产力