AI 出错时不报错,这才是验收真正的难题
传统软件出错会报错、超时、返回非 200,监控盯得住。AI 出错不走这条路:系统一切正常、指标不报警,只是内容是错的。验收真正的难题,是这类错了却没有信号的错误。
上一篇聊的是灰度期站在缓冲区里的那个人,聊他凭什么判断、能不能推翻、什么时候可以不用再站在那儿。这一篇往前走一步:灰度结束了,验收单签了字,系统进了生产——接下来靠什么保证它还是对的。
多数团队在这一步上沿用的是传统软件的那套经验。而这套经验,在 AI 系统上有两处对不上。
出错这件事,AI 系统里没有信号
传统软件的"出错"是有信号的:报错、超时、崩溃、返回码非 200。监控系统盯的就是这些,一有异常就告警。这套东西用了几十年,已经很成熟。
AI 系统不一样。它出错的时候,返回的是一段格式正确、语气自信、长度合适的文本。接口调用成功,响应时间正常,日志里没有 ERROR。从运维视角看,这是一个完全健康的系统。
2024 年 5 月,Google 的搜索 AI 摘要建议用户在披萨酱里加约 1/8 杯无毒胶水,还正经作答了"每天该吃多少石头"。那几天 Google 搜索的可用性、响应时间、错误率一切正常——没有宕机,没有降级,日志里没有 ERROR。
这两条不是系统报出来的,是用户在社交平台上贴出来、媒体跟进报道之后才被处理的。Google 在 5 月 29 日的官方博客里承认了,解释是"数据空腔"——这类问题在网上没有严肃内容,模型只能抓到讽刺帖子和论坛玩笑,然后照着生成。
值得留意的是中间那段时间:从上线到被曝光,监控看板上没有任何一项指标波动过。出问题的是内容,而内容错没错,没有任何系统指标能告诉你。
这里藏着一个容易被忽略的错位。多数团队的监控看板上跑的是系统指标——可用性、响应时间、错误率、并发量。这些指标回答的是"系统还活着吗"。而 AI 系统真正会出问题的地方,需要的是另一套内容指标——输出正确率、需要人工修正的比例、命中兜底路径的次数。这两套指标几乎没有交叠:前者全绿的时候,后者可能已经很差了。验收如果只查前者,等于什么都没查。
"通过"这两个字,默认了它不会变
验收单上那个"通过/不通过"的选项,是从传统软件验收继承来的。它背后藏着一个假设:系统的行为由代码决定,代码不变,行为就不变。所以上线那一刻验一遍,结论长期有效。
AI 系统不满足这个假设。它的输出不只由代码决定,还由知识库里的内容、上游数据的口径、业务规则的当前版本共同决定。这三样东西不需要改一行代码就会变。
- 知识库三个月没更新,新政策进不来,它还在按旧政策答;
- 上游系统把一个字段的枚举值改了,模型还在按老枚举理解;
- 业务上调整了判定标准,但没人想到要去同步那套提示词。
于是会出现一种很尴尬的情况:验收时 90 分,半年后 70 分,中间查不到任何一次变更记录。你翻变更单,什么都翻不到——因为确实没人改过东西。
同样的机制在另一个案例里后果更实在。纽约市 2023 年 10 月上线的 MyCity 商业助手,2024 年 3 月被 The Markup 联合调查披露:它告诉雇主可以从员工小费里抽成,告诉房东可以拒收住房券——这几条在当地都违法。它也不是上线那天就错了,更可能是在持续运行的过程中,再也没有人重新验过一遍。报道发出后,市政府的处置是加一条"beta 产品"的免责声明,机器人继续在线;The Markup 四天后复测,它仍在给出错误答案——记者问它"能不能用它做专业商业建议",它干脆地回答"可以"。
真正该写进验收单的,是谁在什么时候能发现
如果"通过"这个结论既不能保证当下对,也不能保证以后对,那验收单上该写什么?
在我们复盘过的项目里,比较能落地的写法是把"结论"从一栏拆成四栏。这不是行业标准,只是我们试过之后还能推下去的一种格式:
- 抽检比例:上线后按什么比例抽、抽多少条、抽多久。抽的不是系统活着没有,是输出内容对不对。
- 抽检责任人:写具体岗位,不写"相关部门"。这个人得是能判断内容对错的人,不是能看监控的人。
- 触发条件:什么情况下要主动复检——知识库更新超过 N 次、上游字段变更、业务规则调整、距上次验收满一个周期。
- 有效期:这次"通过"管到哪天。到期没复检,结论自动作废。
四栏里最容易漏的是后两栏。因为传统软件的经验是"改了才需要重新验",而 AI 系统的实际情况是"不改也可能变"。
"抽检责任人"这一栏也经常被写成"相关部门"。写成部门基本等于没写——判断一段输出对不对,需要的是业务判断力,这个能力长在具体的人身上,不长在部门上。验收会上如果这一栏过不去,通常不是没人愿意担,是那个真正能判断的人不在场。
至于有效期的长度,在我们复盘过的项目里没有统一答案,取决于它依赖的东西变得有多快:依赖知识库的,跟着知识库的更新节奏走;依赖业务规则的,跟着业务规则的变更走。共同点是——必须有一个具体日期,写"长期有效"就等于没写。
为什么 demo 漂亮,恰恰说明没测到
回到验收会上最常见的那个场景:实施方做了一段演示,几个问题问下来,回答得又快又准,在场的人都挺满意。
问题出在样本上。演示用的是挑过的样本——资料齐全、表述清楚、答案唯一。这类样本恰好是 AI 表现最好的那一批。
而真实业务里占比最高的,往往是另一类:材料不全、表述含糊、几条规则交叉打架。在边界样本上,模型的失败方式不是"我不知道",而是给一个看起来很像答案的答案。它不会报错,会给你一段读起来很顺的话。
所以演示越漂亮,越该问一句:这批测试样本是谁提供的?如果由实施方提供,那基本等于开卷考试——他当然会挑自己跑得顺的那些。
一个成本很低的测试
如果正在准备一次 AI 系统验收,有个测试可以先做,几乎不需要额外投入:
挑 20 条边界样本——不是挑你做得最好那批,是挑"资料不全""表述含糊""涉及多个条款交叉"的真实工单。这 20 条由业务方提供,在验收之前锁定,不告诉实施方是哪 20 条。然后让两个人分别独立判断同一批输出,把不一致的地方列出来。
不一致超过 3 处,说明判断口径还没写清。这跟准确率高低无关,是人和人对"什么叫对"的理解还不一样——这时候谈"通过"没有意义。
这个测试的价值不在于筛出多少错误,在于提前暴露"我们其实还没对齐什么叫对"。纽约市那个机器人如果在验收时做过这一步,"小费能不能抽成"那条大概率当场就会被业务方拦下来。
上线不是终点,验收也不是一次性动作
传统软件交付,验收通过那一天通常意味着项目收尾。AI 系统不一样:验收通过那一天,是它的能力开始自然衰减的第一天。
这句话听起来有点绝对,但说的是一个结构性事实——系统的输入环境在变,而系统自己不会察觉。
还有一步容易被漏掉:抽检发现的问题要有回流路径。抽出来一条错的,然后呢?如果只是记在表里等着下次优化,那抽检就只是记录问题,不解决问题。回流指的是那条错的输出要能被追回去——是知识库缺了这段,还是提示词没说清,还是上游字段变了。追不到原因的错,下次还会再错一次。
更隐蔽的问题在后面:多数企业的知识库是「只进不出」的。文档越攒越多,但没人把「被证伪的那一段」写回去。一条错的输出被追到根因是「知识库缺了这段」,补完之后,换个人问、换个说法,还是缺——因为补进去的内容没有版本、没有责任人、没有生效日期,它只是又多了一篇散落在各处的文件,下一次检索未必能命中。
企业级知识库要补的,是知识资产化的回流机制:每一条被追到根因的错误,都要以「可复用资产」的形态写回系统——谁补的、为什么补、从哪天生效、覆盖哪一类问题,都直接挂在资产本身上。这样同一类问法下次再进来,答案已经被修过,而不是再错一次。它把「发现问题」和「修掉问题」之间那段靠人肉兜着的缝隙,变成系统里一个被记录、被版本化、能被复用的动作。
这恰恰是我们打造 EKOS(企业知识操作系统 K-MS) 的一个内核驱动力。CheersAI 把企业知识操作系统 EKOS 与安全 AI 办公桌面 Desktop 放在一起,想解决的从来不是「再训一个更聪明的模型」,而是让企业知识在系统里能闭环地流动:错了能被发现,发现能追到根因,根因能变成一项写回知识库的资产,资产再被下一轮抽检验证。没有这条回流,知识库就只是一堆文档的坟场;有了这条回流,它才是一个会越长越准的活系统。
所以"生产稳定"在 AI 场景下不是"没出事",是"出事能在可接受的时间内被发现、被追回、被修掉"。它靠的不是更稳的模型,是一套被写下来、并且有人真的按着做的发现机制:抽检比例、责任人、触发条件、有效期,四样齐了,才算真的验过。
灰度期需要有人站在缓冲区里判断;灰度结束之后,这个判断不能凭空消失,它得变成一项被安排好的、有名字的工作。
参考资料
- The Markup(Colin Lecher),2024-03-29,《NYC's AI Chatbot Tells Businesses to Break the Law》——https://themarkup.org/artificial-intelligence/2024/03/29/nycs-ai-chatbot-tells-businesses-to-break-the-law
- The Markup,2024-04-02,《Malfunctioning NYC AI Chatbot Still Active Despite Widespread Evidence It's Encouraging Illegal Behavior》——https://themarkup.org/news/2024/04/02/malfunctioning-nyc-ai-chatbot-still-active-despite-widespread-evidence-its-encouraging-illegal-behavior
- Google 官方博客,2024-05-29,《AI Overviews: About last week》——https://blog.google/products/search/ai-overviews-update-may-2024/
- 纽约市 MyCity 机器人后续处置,多家媒体转载报道(China Daily Asia、《Firstpost》等),2024-04
关于作者
延伸阅读:配套实操包
方法讲清了,落地还需配套模板与逐步骤清单。我把《AI 验收四栏实操包》(抽检比例+责任人+触发条件+有效期工作表)放在「球者AI进化论」知识星球,订阅后可下载使用。更多企业 AI 落地方法见官网 https://www.cheersai.cloud