我把“稍后再看”变成了一个会回答问题的 AI 知识库
一个不写代码的人,怎么把散落各处的资料,变成 AI 能读懂、能引用、还敢说“不知道”的私人知识库。

引语:一个不写代码的人,怎么把散落各处的资料,变成 AI 能读懂、能引用、还敢说「不知道」的私人知识库。
上周末,一场 Mastermind 之后

上周末,我参加了 Simon 老师组织的一场 Mastermind。
活动结束以后,跟不同的人聊下来,我脑子里冒出一个念头。
我过去这段时间一直在折腾的这些东西,是不是对别人也有用?
我不是什么大佬,也不觉得自己有多懂 AI。但有一点是真的,我在真实的工作里,把 AI 一点点用起来了。有些地方成功了,有些地方失败了,还有不少做到一半发现走不通,只能回头重来。
这些过程,原本都是我自己闷头在搞。
但那场活动之后,我开始觉得,与其让它们躺在我的电脑和聊天记录里,不如写下来。
于是,就有了这个公众号。
它叫「是哆啦 AI 梦」。
第一篇,我想从自己的知识库写起。因为它是我最近觉得最值得分享、也最希望有人能一起讨论的一件事。
我为什么要建知识库

先说清楚,我想做的知识库,不是那种把所有文件塞进去、然后假装自己很懂的东西。
我有大量资料散在各处。课程、PDF、公众号文章、群聊里的讨论、会议记录、截图,还有真实业务里产生的文件。它们不是没有价值,问题是,等我真的要回答一个业务问题时,这些资料很难被用起来。
直接问 AI 当然可以。但它不知道我手里有哪些资料,也不知道哪些来源我验证过。每开一个新对话,它都得重新认识我一次。
所以我真正想做的,是给 AI 补上一段只属于我的记忆。
它知道我读过什么,资料从哪里来,不同的人说过什么,哪些判断被真实业务验证过,哪些问题到现在还没有答案。
这套记忆,就是我的知识库。
为什么不直接用现成知识库

市面上的知识库工具并不少。像 Obsidian,很适合做本地笔记、双向链接和长期整理;像 WorkBuddy 这类带 AI 能力的工作台,上手更快,把资料放进去就能开始问答。
它们都很好,只是解决的问题和我想解决的问题不完全一样。
我不只想“把资料放进去”。我还想决定资料怎么进入、图片怎么 OCR、重复内容怎么清洗、长文怎么切片、每句话怎样保留来源,以及业务结果怎么重新回到知识库。
现成工具的优点是省心、开箱即用;代价是流程要跟着产品走。自建的缺点也很明显:更费时间,需要维护,还会不断返工。但它的好处是,我可以让知识库跟着真实业务长,而不是让业务迁就一个固定工具。
所以我最后没有把选择题做成“哪个工具最好”,而是先问自己:我究竟想把哪一段流程掌握在手里?
整套系统怎么转

我把整套系统拆成了六环,每一环解决一个具体的问题。
第一环,资料从哪里来。

我的资料主要来自两个底座。
一个是本地。PDF、图片、截图、业务文件,原件尽量保存在自己的电脑里。本地负责把东西真正留下来。
另一个是接口。能从外部读到的内容,可以通过接口直接进入处理流程,不用全靠我手动复制粘贴。接口负责让信息流动起来。
第二环,OCR,把图片变成能搜索的文字。

我资料里有大量图片和扫描 PDF。它们人眼能看懂,系统却看不懂。OCR 就是先把图片里的字,重新变成可以搜索和处理的文字。
但 OCR 的结果不能直接用。数字容易认错,表格容易乱,专业名词可能被拆得面目全非。所以 OCR 之后,关键内容还得人工核对,这一环偷不了懒。
第三环,清洗和去重。

文字能识别以后,要把页眉页脚、广告、乱码、重复段落清掉。
去重尤其重要。同一篇文章,可能同时出现在网页、截图和转发文件里。如果不去重,AI 会把同一个人的同一句话,当成好几份证据。
出现得多,不代表更多人认同。这个道理,是我搭知识库以后才真正意识到的。
第四环,拆成知识片段,保留出处。

长文档不能整本丢进去。因为我要问的是具体问题,AI 需要找到真正相关的那几段。
所以文档会被拆成一个个意思完整的知识片段。但拆分不能太粗暴,一条规则的前提和结论不能拆开,一个观点也不能脱离它原来的语境。
每个片段还要留下自己的出处。谁写的,什么时候写的,来自哪个文件,原文在哪。这样以后发现某个信息不对,我还能顺着来源走回去核对。
第五环,向量化,让系统理解意思。

这一步稍微有点技术,我用大白话讲。
普通搜索找的是相同的字。但现实中,我问「利润为什么下降」,资料里写的可能是「广告成本上涨」或「退货率增加」。字不一样,意思却是同一件事。
向量化要做的事,就是让系统能根据意思找到相关的内容,而不是只会找一模一样的字。
但找到相关片段,只说明它相关,不代表它一定正确。所以检索之后,判断还没结束。
第六环,RAG,先找证据,再回答。

找到资料以后,AI 不是凭记忆直接回答,而是先拿到相关片段和来源,再基于这些证据组织答案。
我给知识库定的规则是,回答不能只有一段流畅的话。它要告诉我,结论是什么,证据来自哪里,哪些是原文明确说过的,哪些是 AI 自己的推断,资料之间有没有冲突,还缺什么资料。
如果证据不够,它应该直接说不知道,而不是编一个听起来很合理的答案。
还有最后一环,是业务

知识库不能只进不出。
真实业务里发生了什么,要回到知识库里。这个判断后来被验证了吗?那个建议放到业务里,有没有效果?哪些方法只在特定条件下才成立?
只有这一环接通,知识库才不是资料搬运现场,而是会跟着业务一起长大的东西。
它现在能做什么

老实说,它还在长大,远没到完美的程度。
但有一件事是真的变了。
以前我打开一个新的 AI 对话,要从头介绍自己。现在我可以直接问它一个业务问题,它会从知识库里找到相关的资料,把证据摆出来,然后告诉我结论、限制和缺口。
它不知道的时候,会直接说不知道。
光这一点,就已经让我觉得,这段记忆补得值。
如果你也感兴趣
这个公众号,我会继续记录自己怎么把 AI 用进真实的工作,成功的、失败的、返工的,都会写。
如果大家对我具体是怎么实现的、以及最后折腾出了什么,感兴趣的话,可以点赞、关注、收藏。
想看的人多,我就接着往下拆。