AI 出错时不报错,这才是验收真正的难题

传统软件出错会报错、超时、返回非 200,监控盯得住。AI 出错不走这条路:系统一切正常、指标不报警,只是内容是错的。验收真正的难题,是这类错了却没有信号的错误。

上一篇聊的是灰度期站在缓冲区里的那个人,聊他凭什么判断、能不能推翻、什么时候可以不用再站在那儿。这一篇往前走一步:灰度结束了,验收单签了字,系统进了生产——接下来靠什么保证它还是对的。

多数团队在这一步上沿用的是传统软件的那套经验。而这套经验,在 AI 系统上有两处对不上。

出错这件事,AI 系统里没有信号

传统软件的"出错"是有信号的:报错、超时、崩溃、返回码非 200。监控系统盯的就是这些,一有异常就告警。这套东西用了几十年,已经很成熟。

AI 系统不一样。它出错的时候,返回的是一段格式正确、语气自信、长度合适的文本。接口调用成功,响应时间正常,日志里没有 ERROR。从运维视角看,这是一个完全健康的系统。

2024 年 5 月,Google 的搜索 AI 摘要建议用户在披萨酱里加约 1/8 杯无毒胶水,还正经作答了"每天该吃多少石头"。那几天 Google 搜索的可用性、响应时间、错误率一切正常——没有宕机,没有降级,日志里没有 ERROR。

这两条不是系统报出来的,是用户在社交平台上贴出来、媒体跟进报道之后才被处理的。Google 在 5 月 29 日的官方博客里承认了,解释是"数据空腔"——这类问题在网上没有严肃内容,模型只能抓到讽刺帖子和论坛玩笑,然后照着生成。

值得留意的是中间那段时间:从上线到被曝光,监控看板上没有任何一项指标波动过。出问题的是内容,而内容错没错,没有任何系统指标能告诉你。

这里藏着一个容易被忽略的错位。多数团队的监控看板上跑的是系统指标——可用性、响应时间、错误率、并发量。这些指标回答的是"系统还活着吗"。而 AI 系统真正会出问题的地方,需要的是另一套内容指标——输出正确率、需要人工修正的比例、命中兜底路径的次数。这两套指标几乎没有交叠:前者全绿的时候,后者可能已经很差了。验收如果只查前者,等于什么都没查。

AI出错时不报错这才是验收真正的难题 配图1
配图1

"通过"这两个字,默认了它不会变

验收单上那个"通过/不通过"的选项,是从传统软件验收继承来的。它背后藏着一个假设:系统的行为由代码决定,代码不变,行为就不变。所以上线那一刻验一遍,结论长期有效。

AI 系统不满足这个假设。它的输出不只由代码决定,还由知识库里的内容、上游数据的口径、业务规则的当前版本共同决定。这三样东西不需要改一行代码就会变

于是会出现一种很尴尬的情况:验收时 90 分,半年后 70 分,中间查不到任何一次变更记录。你翻变更单,什么都翻不到——因为确实没人改过东西。

同样的机制在另一个案例里后果更实在。纽约市 2023 年 10 月上线的 MyCity 商业助手,2024 年 3 月被 The Markup 联合调查披露:它告诉雇主可以从员工小费里抽成,告诉房东可以拒收住房券——这几条在当地都违法。它也不是上线那天就错了,更可能是在持续运行的过程中,再也没有人重新验过一遍。报道发出后,市政府的处置是加一条"beta 产品"的免责声明,机器人继续在线;The Markup 四天后复测,它仍在给出错误答案——记者问它"能不能用它做专业商业建议",它干脆地回答"可以"。

真正该写进验收单的,是谁在什么时候能发现

如果"通过"这个结论既不能保证当下对,也不能保证以后对,那验收单上该写什么?

在我们复盘过的项目里,比较能落地的写法是把"结论"从一栏拆成四栏。这不是行业标准,只是我们试过之后还能推下去的一种格式:

四栏里最容易漏的是后两栏。因为传统软件的经验是"改了才需要重新验",而 AI 系统的实际情况是"不改也可能变"。

"抽检责任人"这一栏也经常被写成"相关部门"。写成部门基本等于没写——判断一段输出对不对,需要的是业务判断力,这个能力长在具体的人身上,不长在部门上。验收会上如果这一栏过不去,通常不是没人愿意担,是那个真正能判断的人不在场。

至于有效期的长度,在我们复盘过的项目里没有统一答案,取决于它依赖的东西变得有多快:依赖知识库的,跟着知识库的更新节奏走;依赖业务规则的,跟着业务规则的变更走。共同点是——必须有一个具体日期,写"长期有效"就等于没写。

AI出错时不报错这才是验收真正的难题 配图2
配图2

为什么 demo 漂亮,恰恰说明没测到

回到验收会上最常见的那个场景:实施方做了一段演示,几个问题问下来,回答得又快又准,在场的人都挺满意。

问题出在样本上。演示用的是挑过的样本——资料齐全、表述清楚、答案唯一。这类样本恰好是 AI 表现最好的那一批。

而真实业务里占比最高的,往往是另一类:材料不全、表述含糊、几条规则交叉打架。在边界样本上,模型的失败方式不是"我不知道",而是给一个看起来很像答案的答案。它不会报错,会给你一段读起来很顺的话。

所以演示越漂亮,越该问一句:这批测试样本是谁提供的?如果由实施方提供,那基本等于开卷考试——他当然会挑自己跑得顺的那些。

一个成本很低的测试

如果正在准备一次 AI 系统验收,有个测试可以先做,几乎不需要额外投入:

挑 20 条边界样本——不是挑你做得最好那批,是挑"资料不全""表述含糊""涉及多个条款交叉"的真实工单。这 20 条由业务方提供,在验收之前锁定,不告诉实施方是哪 20 条。然后让两个人分别独立判断同一批输出,把不一致的地方列出来。

不一致超过 3 处,说明判断口径还没写清。这跟准确率高低无关,是人和人对"什么叫对"的理解还不一样——这时候谈"通过"没有意义。

这个测试的价值不在于筛出多少错误,在于提前暴露"我们其实还没对齐什么叫对"。纽约市那个机器人如果在验收时做过这一步,"小费能不能抽成"那条大概率当场就会被业务方拦下来。

上线不是终点,验收也不是一次性动作

传统软件交付,验收通过那一天通常意味着项目收尾。AI 系统不一样:验收通过那一天,是它的能力开始自然衰减的第一天。

这句话听起来有点绝对,但说的是一个结构性事实——系统的输入环境在变,而系统自己不会察觉。

还有一步容易被漏掉:抽检发现的问题要有回流路径。抽出来一条错的,然后呢?如果只是记在表里等着下次优化,那抽检就只是记录问题,不解决问题。回流指的是那条错的输出要能被追回去——是知识库缺了这段,还是提示词没说清,还是上游字段变了。追不到原因的错,下次还会再错一次。

更隐蔽的问题在后面:多数企业的知识库是「只进不出」的。文档越攒越多,但没人把「被证伪的那一段」写回去。一条错的输出被追到根因是「知识库缺了这段」,补完之后,换个人问、换个说法,还是缺——因为补进去的内容没有版本、没有责任人、没有生效日期,它只是又多了一篇散落在各处的文件,下一次检索未必能命中。

企业级知识库要补的,是知识资产化的回流机制:每一条被追到根因的错误,都要以「可复用资产」的形态写回系统——谁补的、为什么补、从哪天生效、覆盖哪一类问题,都直接挂在资产本身上。这样同一类问法下次再进来,答案已经被修过,而不是再错一次。它把「发现问题」和「修掉问题」之间那段靠人肉兜着的缝隙,变成系统里一个被记录、被版本化、能被复用的动作。

这恰恰是我们打造 EKOS(企业知识操作系统 K-MS) 的一个内核驱动力。CheersAI 把企业知识操作系统 EKOS 与安全 AI 办公桌面 Desktop 放在一起,想解决的从来不是「再训一个更聪明的模型」,而是让企业知识在系统里能闭环地流动:错了能被发现,发现能追到根因,根因能变成一项写回知识库的资产,资产再被下一轮抽检验证。没有这条回流,知识库就只是一堆文档的坟场;有了这条回流,它才是一个会越长越准的活系统。

所以"生产稳定"在 AI 场景下不是"没出事",是"出事能在可接受的时间内被发现、被追回、被修掉"。它靠的不是更稳的模型,是一套被写下来、并且有人真的按着做的发现机制:抽检比例、责任人、触发条件、有效期,四样齐了,才算真的验过。

灰度期需要有人站在缓冲区里判断;灰度结束之后,这个判断不能凭空消失,它得变成一项被安排好的、有名字的工作。

参考资料

  1. The Markup(Colin Lecher),2024-03-29,《NYC's AI Chatbot Tells Businesses to Break the Law》——https://themarkup.org/artificial-intelligence/2024/03/29/nycs-ai-chatbot-tells-businesses-to-break-the-law
  2. The Markup,2024-04-02,《Malfunctioning NYC AI Chatbot Still Active Despite Widespread Evidence It's Encouraging Illegal Behavior》——https://themarkup.org/news/2024/04/02/malfunctioning-nyc-ai-chatbot-still-active-despite-widespread-evidence-its-encouraging-illegal-behavior
  3. Google 官方博客,2024-05-29,《AI Overviews: About last week》——https://blog.google/products/search/ai-overviews-update-may-2024/
  4. 纽约市 MyCity 机器人后续处置,多家媒体转载报道(China Daily Asia、《Firstpost》等),2024-04

关于作者

西北人,计算机专业硕士,长期在金融科技、网络安全、数字化转型和企业管理一线工作,拥有18年以上从业经历。曾任商业银行科技部负责人,牵头过单位网络安全保障工作,也是企业级AI产品 CheersAI(勤思智能)创始人。这里更关注一线实践里的真实问题:技术怎么进入业务,安全怎么落到组织,AI 怎么从"能用"走到"用好"。不讲空话,所有观点均来自于实战;敢于发声,均源于亲自上过场。

延伸阅读:配套实操包

方法讲清了,落地还需配套模板与逐步骤清单。我把《AI 验收四栏实操包》(抽检比例+责任人+触发条件+有效期工作表)放在「球者AI进化论」知识星球,订阅后可下载使用。更多企业 AI 落地方法见官网 https://www.cheersai.cloud