📌 技术分享 · 每日更新

把 PDF/图纸/政策变成可检索知识库

苏运AI · 发布于 2026-09-27

为什么我们攒了个知识库

做 B2B 获客这一年,最痛的不是「没资料」,而是「资料有一堆,要用的时候找不到」。售电政策 PDF、客户比价表、招标文件、合同模板、竞品截图——散在桌面、微信收藏、浏览器书签里,每次写方案都得翻半小时。后来我们把这些散落资料统一沉淀到一个可检索知识库,检索效率直接翻了好几倍。这不是多高深的事,关键是先定结构,再灌数据。

我们怎么搭的(真实路径)

主库用了乐享知识库(团队空间),按业务线分了 7 个一级分类:GEO 获客、售电购电、智能体搭建、变现创业、本地 AI、学习资料、出行踩线,再加一个「待分类」兜底。每个分类下再按「政策 / 案例 / 模板 / 工具」二级整理。

做对了:先画分类树,再往里塞。一开始我们贪多,把 200 个文件一次性丢进去,结果检索出来一堆无关项,反而更乱。后来回退重来,先定 7 个分类、每类定 3~4 个二级标签,灌数据才顺。

售电政策怎么沉淀

售电这块政策更新极快(164 号文、2027 零售套餐细则、月度竞价、输配电价),我们把每份文件拆成「来源 + 时间 + 关键数字 + 我的解读」四字段存。比如 2026 年度长协均价、月度竞价走势、服务费上限 2 分/度,都抽成结构化条目,写周报时直接引用,不再翻原文。

小技巧:政策类一定要带「报道时间」和「来源全称」。我们吃过亏——一条关联简报因为漏了时间字段被驳回重写。时间不全的政策,宁可不录。

采集与去重

每日自动化会抓一批网页/文件进库,但重复是常态。我们写了去重脚本(按标题+URL 判重),重复运行安全。去重前先落一个 synced.txt 记录已处理项,再跑同步,避免同一条进两次。

踩过的坑:早期没做去重,同一份招标文件被采集了 4 遍,库里全是副本,检索时前 4 条都是它。去重脚本上线后才干净。

私密库和公开库必须分开

知识库分两层:一层是内部工作库(记忆、日志、台账、客户线索、合同卷宗),真名真号都在里面,只给自己用;一层是对外公开库(站点页面、技术分享、政策简报网页版),对外一律用「华先生」代称、手机号脱敏。两套库物理隔离,绝不混写。这是合规底线,宁可麻烦也不能把客户隐私漏到公开页。

「垃圾进垃圾出」是真道理

知识库不是垃圾桶。我们定的规矩:① 每条必须带来源和时间;② 数字必须可核实,编不出的不写;③ 截图/扫描件读不到内容就放下,绝不凭印象补;④ 每周做一次体检,把过期和空壳条目清掉。

给后来者的可抄动作

如果你也想搭:先拿一张纸画出你的业务分类(别超过 7 个一级),每类想清楚要存哪几类东西;挑一个顺手的库(乐享、Notion、本地 Markdown 都行,免费优先);写个采集+去重的小脚本;最重要的是——今天就开始定结构,明天再灌第一条。结构定了,后面只是体力活。

← 返回技术分享栏目,看更多每日分享