另一个被这次测试放大的现象是"领域依赖度"。同样的 AI 模型,在"一般知识问答"上表现稳定,但在"信用债尽调"这种对原文高度依赖的领域里表现明显下滑。这个下滑不是模型能力问题,是工作流问题——AI 在没有强约束的工作流里会倾向于"看起来合理"而非"完全准确"。换句话说,越是专业、越是对原文敏感的领域,越要给 AI 加约束;越是常识、越是不依赖原文的领域,反而可以放松。
二、引用失真的三种原因占比
把那 12 条失真案例拆开看,原因集中在三类:
片段被截断,语境丢失:7 条。AI 抓到一段文字但只用了半句,前后语境没拉进来。比如评级报告里有一句"短期债务占比偏高,但公司账面现金充裕",AI 只引用了前半句,结论就变成"短期偿债压力大"。这种情况下,用户看到的引用是真实的,但引用之外的语境被 AI 自己补全了——补全的部分就是失真的源头。
跨文档拼接,主体错位:3 条。AI 把 A 公司的某段文字接到了 B 公司的回答里。比如 A 公司的处罚决定书说"罚款 50 万元",AI 把这个数字安到了 B 公司的处罚情况上。这种失真最隐蔽——引用的原文是真实的,但主体错了,错的主体让真实原文变成了虚假信息。
三类失真的比例分布背后有一个规律:失真越严重,占比越低,但危害越大。"片段截断"占 58%,危害最低(用户多看一眼就能发现);"跨文档拼接"占 25%,危害中等(需要交叉核对才能发现);"AI 编造"占 17%,危害最高(根本无法靠人工核对发现,因为引用本身就不存在)。所以治理 AI 失真,不能平均用力——要把 80% 的力气放在"AI 编造"和"跨文档拼接"这两类危害最大的失真上。
三、把 12 条失真案例归为四种改写策略
光知道失真原因还不够,关键是改写策略。这次让 AI 把这 12 条失真案例按"怎么改能避免"重新过一遍,归纳出四种策略:
第一,切块检索。把长文档切成段落级、表格级的小块,让 AI 按块检索,而不是整篇吞下后再提取。整篇吞的模式下,AI 容易抓到一段被截断的文字;切块后,每个块都有完整语境,引用错位概率大幅下降。具体做法是把 PDF 按"自然段+表格"切成 200—500 字的小块,每块单独建索引,AI 检索时只返回最相关的 3—5 个块,避免一次性塞入过多文本。
第二,回带上下文。AI 抓到一段文字时,把前一段和后一段也喂回去,让 AI 看完整的语境,而不是断章取义。这一步对"片段被截断"的失真特别有效。在工程实现上,可以在每个块上保留"前驱块 ID"和"后继块 ID",检索到目标块时自动带上前后各一块作为语境——这样 AI 看到的引用永远是完整的,不是孤立的。
第四,拒答规则。当 AI 检索不到对应公告或材料时,必须回答"未找到相关资料,建议人工核实",而不是编一个看起来合理的答案。这一步看着简单,实际上是对 AI 工作流最大的约束。在 prompt 里要写死这条规则:"如果你没有在指定材料里找到答案,禁止用任何形式的'通常来说''一般而言''行业惯例是'等模糊表述;只能回答'未找到相关资料'。"
另一个更深层的差异是"职责分离"。改写前,AI 既负责检索又负责回答又负责判断——一个环节出错,整条链都错。改写后,每个环节有专门的检查点:检索错了切块自查能发现、语境错了回带自查能发现、回答错了引用校验能发现、不确定时拒答规则能兜底。职责分离让 AI 系统的失败模式从"整体崩盘"变成"局部失败"——局部失败可以被人工修补,整体崩盘只能重做。这种"系统韧性"的提升,是数字之外更重要的变化。
五、信用问答的 AI 边界,比想象的窄
做完这一轮,最大的感受是:信用问答是 AI 的高风险场景,不能照搬通用问答的做法。通用问答里,AI 答错了用户可以一笑而过;信用问答里,AI 答错了可能直接影响投资决策。
每一个判断都要有证据:AI 说"这家发行人偿债能力较弱",必须能指出是哪份材料的哪一段支持这个判断。不能用"综合考虑""整体来看"这种模糊表达。在 prompt 里可以加规则:"禁止使用'综合考虑''整体来看''通常情况下'等无支撑表达;所有判断必须以'根据 XX 报告第 XX 页,XX 显示……'的格式给出"。
这三个要求背后的共同逻辑是:信用场景对错误的容忍度极低。一次错误可能直接造成资金损失,所以 AI 必须用"看起来啰嗦"的工作流换取"实际安全"。这种取舍在通用问答里是多余的,在信用问答里是必须的。
六、把"AI 引用校验"移植到法律和医疗场景
做完信用场景的 100 条测试后,忍不住又把"AI 引用校验"这套工作流试了两个其他场景:
场景一:法律咨询。让 AI 根据最高法院发布的指导案例回答 50 个常见法律问题。结果:完全正确率 60%,失真率 20%。失真集中在"案例编号记错""判决日期记错""原告被告搞混"这类细节问题。改写策略上,加"原文截图必传"环节,失真率降到 5%。法律场景的失真特点比信用场景更"细节"——AI 不会编造整段文字,但会在具体编号、日期、人名上出错。这种失真危害很大,因为法律文书的细节就是法律文书的全部。
场景二:医疗问答。让 AI 根据临床指南回答 50 个常见病诊断问题。结果:完全正确率 75%,失真率 8%。失真集中在"剂量记错""禁忌症遗漏"这类高风险细节。改写策略上,加"剂量引用必查药典原文"环节,失真率降到 2%。医疗场景的失真危害比信用和法律都要严重——医疗剂量错了可能直接危及生命。所以医疗场景的 AI 工作流要更严:不仅要求引用必查原文,还要加上"剂量数字必须从药典原文复制,禁止改写"这种"零容忍"规则。
三个场景跑下来,最大的共性是:失真率高的 AI 不是"模型不够大",而是"工作流缺少自查环节"。每个场景的失真类型不同,但对策都是"让 AI 的工作流多几道自查"。这一套方法可以移植到任何一个 AI 辅助的高风险场景里。
三个场景的差异也很明显:法律场景的失真是"细节错"(编号、日期)、医疗场景的失真是"高风险错"(剂量、禁忌)、信用场景的失真是"主体错"(A 公司的事安到 B 公司)。针对不同的失真类型,要加的"自查环节"也不同——法律场景加"截图必传"、医疗场景加"原文复制"、信用场景加"主体核对"。通用方法 + 场景定制,是 AI 引用校验的工程化范式。