← 返回文章
·约 7 分钟阅读·AI 用进真实工作

我把资料丢进知识库后,AI 反而更容易胡说了

知识库不是资料越多越聪明。重复、过期、识别错误和无法追溯的内容,会让 AI 更有底气地给出错误答案。

我把资料丢进知识库后,AI 反而更容易胡说了

哈喽,我是阿梦。这个公众号,我会持续记录自己怎么把 AI 用进真实的工作,成功的、失败的、返工的,都是我的来时路~

去微信公众号「是哆啦 AI 梦」看看 →

哈喽,我是阿梦。这个博客,我会持续记录自己怎么把 AI 用进真实的工作,成功的、失败的、返工的,都是我的来时路~

刚开始做知识库时,我有一个非常朴素的想法:

只要把资料尽可能多地放进去,AI 知道的东西就会越来越多。

于是,文章、PDF、会议截图、聊天记录、网页内容……能收的,我都往里面放。

知识库确实越来越大。

但 AI 的回答,并没有跟着变得越来越靠谱。

有时,它引用了一段已经过期的资料。

有时,它把网页底部的广告语当成正文。

还有一次,同一个问题明明有一份完整资料,它却偏偏抓住了 OCR 识别错的一句话,然后非常认真地给我解释了一遍。

那一刻我才意识到:

知识库不是资料越多越聪明。如果放进去的都是噪音,AI 只会更有底气地胡说。

AI 的“胡说”,可能来自我的资料

混乱资料进入知识库后,AI 可能根据噪音生成错误答案

我们很容易把错误归因于模型:

是不是 AI 不够聪明?是不是 RAG 检索不准?是不是提示词还不够详细?

但在真实知识库里,还有一种更常见的情况:

AI 确实检索到了资料,只不过检索到的资料本身就有问题。

它并不知道哪一句是正文,哪一句是广告,也不知道两个内容相似的文件,哪个才是最新版本。

它看到一段文字出现在知识库里,就有可能把它当成回答依据。

所以,AI 的答案看起来像是在“胡说”,实际上它可能只是在非常忠实地复述噪音。

什么是知识库里的噪音?

知识库里常见的五类噪音

噪音不一定是完全没用的内容。

更多时候,它是那些混在资料里、看起来像知识,却会干扰检索和理解的东西。

第一类:页面里反复出现的无关文字

从网页、PDF 和公众号文章中提取文字时,经常会把导航菜单、登录提示、版权声明、广告、相关推荐、页眉页脚,以及点赞关注等固定文案一起带进来。

这些文字单独看没有错,但它们会在大量文章中反复出现。

如果每篇文章结尾都有“点赞、收藏、转发”,这句话出现的次数,可能比真正重要的业务概念还多。

检索系统并不知道它只是固定模板。真正有用的内容可能被淹没,模板文字反而获得了不应该有的存在感。

第二类:OCR 识别留下的碎片

上一篇写到,我会先用本地 OCR,把会议照片、截图和扫描件变成可检索的文字。

但“识别出来”不等于“识别正确”。

OCR 之后经常会出现错字、断行、乱码、两栏内容错拼、表格顺序打乱,以及同一页被重复识别。

人看原图时,可能一眼就知道它在说什么。但进入知识库以后,AI 看到的可能只是一段残缺文字。

它不会自动知道这里有错字,也不一定会回头查看原图。如果这段文字恰好与问题中的关键词相似,它仍然可能被检索出来。

第三类:同一份资料重复出现

一份资料可能同时存在于本地文件、飞书文档、网页收藏、会议附件和再次导出的 PDF 中。

文件名不同,不代表内容不同。

如果同一段内容在知识库里出现五次,检索时很可能返回五个几乎一样的片段。

表面上看,AI 找到了五份证据;实际上,它只是找到了同一份证据的五个副本。

重复,不等于交叉验证。

第四类:新旧版本互相打架

一份旧方案写着“建议采用方案 A”,一周后的新版本可能已经改成“方案 A 暂停,改用方案 B”。

如果两份资料都进入知识库,却没有日期和版本标记,AI 并不知道哪一份更新。

它可能引用旧方案,也可能把两个版本拼在一起,最后给出一个每句话都有出处、合起来却完全错误的答案。

第五类:没有来源的“孤儿文字”

有些文字被提取出来以后,只剩下一段正文。

它没有标题、作者、时间,也不知道来自会议、网页还是聊天记录。

这种内容最大的风险不是它一定错误,而是它无法核查。

AI 可以引用它,但我没办法继续追问:这是谁说的?什么时候说的?现在是否还有效?我能不能回到原文确认?

一段无法追溯的文字,即使内容正确,也很难成为可靠的业务依据。

我是怎么清理这些噪音的?

资料从待处理区经过清理、去重、版本判断和来源补全,再进入正式知识库

我现在不会把刚收集到的资料直接放进正式知识库。

它们会先进入一个“待处理区”。原始文件保留不动,清理出来的版本单独生成。

这样即使清理错了,我也随时可以回到原件,而不是让 AI 直接改写唯一的一份资料。

第一步:删掉明显的模板内容

这一层主要处理规则明确、可以批量判断的噪音:重复页眉页脚、页码、网页导航、版权信息、广告区、关注提示、连续空行和异常符号。

这类工作不需要每次都调用大模型。

很多内容可以通过本地脚本、关键词规则和页面结构直接完成,不消耗模型 Token。

我会优先让电脑做那些答案明确的机械工作。

因为如果一开始就把整批原文交给 AI 清洗,不仅成本更高,AI 还可能顺手润色、概括,甚至修改原意。

可以删除确定的噪音,但不要悄悄重写事实。

第二步:修复 OCR 造成的结构问题

OCR 的错字不一定都能自动修正,但明显的结构问题可以先处理。

例如合并被强制换行的句子、删除单独乱码、恢复标题层级、标记表格和图片位置,以及合并重复识别的页面。

我不会让 AI 在没有原图的情况下大量“猜测”错字。

特别是金额、日期、人名、产品型号和关键结论,我会要求它回到原图核对。

通顺,不等于正确。

第三步:给资料去重

去重不只是看文件名。

我会依次判断:文件是否完全相同、正文是否大面积重复、是否只是格式不同,以及是否属于同一资料的不同版本。

完全相同的副本只保留一份;内容高度相似但并不完全相同的,则先判断是不是不同版本。

删掉重复资料很简单,但误删一次修改后的重要内容,代价就大了。

第四步:处理互相冲突的版本

遇到新旧版本,我不会要求 AI 自己猜哪一份正确。

我会给资料补上创建时间、更新时间、版本号、当前状态、是否已被替代和原始来源。

旧版本不一定要删除,它对复盘认知变化很有价值。

但在检索时,需要明确告诉系统:这是一份历史记录,不应该作为当前方案的首选依据。

第五步:给内容补回来源

清理后的内容,至少要保留一张简单的“身份证”:资料标题、文件类型、原始路径或链接、作者或记录人、创建日期、所属项目、当前版本,以及是否经过人工确认。

这些信息能帮助检索系统筛选内容,也能让 AI 在回答时一并返回出处。

我的要求不是 AI 必须永远正确,而是:

当它可能出错时,我能够顺着来源找到原文。

第六步:隔离不确定的内容

有些资料并不能自动判断,例如 OCR 质量太差、来源不明、版本无法确认、关键数字前后矛盾,或者内容可能已经失效。

这类资料,我不会强行塞进正式知识库,也不会直接删除,而是放进“待确认区”。

知识库的清理,不是追求百分之百自动化。

有时候,最可靠的自动化结果就是:

我不确定,这一份需要你看一下。

清理之后,AI 就不会胡说了吗?

当然不是。

后面还有很多环节会影响答案:文章怎么切分、标签怎么设置、检索返回多少内容、来源如何排序,以及 AI 是否真的根据证据回答。

但至少,清理能解决一个非常基础的问题:

不要让错误、重复、过期和无法追溯的内容,披着“知识”的外衣进入检索。

否则,我们做出来的可能不是知识库,而是一个更方便 AI 翻阅的杂物间。

我判断资料能不能入库,只看四件事

  1. 正文是否完整,还是混入了网页模板与 OCR 乱码?
  2. 它是不是和已有资料重复?
  3. 它是不是当前有效的版本?
  4. 我能不能找到它的原始来源?

以前我以为,做知识库就是不断往里面放东西。

后来才发现,比“收进去”更重要的,是知道什么值得留下。

我想做的,不是一个塞满资料的仓库,而是一个我愿意相信、也能随时回去核对的地方。

下一篇,我们继续聊:清理好的长文章,为什么还要先被“切碎”。