知识库质量跃升:从 9.3 到 9.7

知识库 3.0:从 9.3 到 9.7 —— 一次质量跃升的完整路径

我给自己那个本地知识库打了两年多的分。 9 月 10 日晚上,它拿到 9.3 / 10。理由很充分:23 条死链、10 篇笔记缺 frontmatter、5 个收件箱积压、一个战略主题零覆盖。 三个小时后,同一套方法、同一套权重、同一批命令,再算一遍:9.7 / 10。 这三个小时里,我没有往库里加一行新知识。只是把已经烂掉的地方挖出来扔了。 但真正的故事不在 9.3 到 9.7。真正的故事是——第一份写着"9.7"的报告里,有一处举证是不实的,而且是复核的时候才发现的。 这是"本地 AI 知识库实践"系列的第五篇。前面四篇讲的是怎么搭(从零搭建本地 AI 知识库)、怎么更聪明、怎么让数字可信(卡片索引层)、2.0 时代改了哪些东西(知识库 2.0 升级全解)。这一篇讲的是怎么证明它真的好——以及为什么"它说自己好"这句话本身不可信。 本文全部数字来自 2026-09-10 的现场实测命令,可复现。你的库不必有相同的数字,方法相同即可。 一、三个小时:完整时间线 整件事从当天晚上 22:47 开始,到 23:58 结束。 时间 动作 结果 22:47 第一次审计(六维评分模型) 9.3 / 10,三项 P1/P2 弱点 23:00–23:18 弱点清零执行 死链 23→0、缺 frontmatter 10→0、收件箱积压 5→0 23:18–23:30 复审(同方法、同权重) 9.7 / 10,九项门槛全过 23:31–23:45 独立复核(另一个 Agent 重跑全部指标) 采信 9.7,但发现 1 项举证不实 + 2 项需修正 + 4 项缺口 23:40–23:58 缺口全量执行 7 项动作落地,向量块 121,951 → 122,120 收尾 稳态复核 死链 0 / frontmatter 0 / 漂移 0 / 积压 0 / 回归 21/21 注意中间那一行——复审和独立复核是两个不同的动作,由两个不同的角色做。 ...

2026-09-11 · Gary
知识库 2.0 四层架构升级

知识库 2.0 升级全解:11 个升级点的逻辑与好处(附 AI 可执行搭建包)

这是"本地 AI 知识库实践"系列的第四篇。前面三篇分别讲了:怎么搭(v1 搭建)、怎么更聪明(v2 多跳检索 + 看板)、怎么让数字可信(知识库 2.0 卡片索引)。 这篇把 2.0 时代的全部升级点一次性讲透:每个点改了什么、为什么改、逻辑是什么、好处是什么——不是"我做了这些",而是"我为什么这么做"。 文末附一段可以直接复制给任何 AI 助手的搭建包:5 个可运行脚本 + 验收清单,AI 照着就能在一个全新目录里复刻整套架构。 本文数字均来自 2026-08-31 实测(记分卡 + 自动化清单交叉核验),非估算。你的数字不必相同,架构相同即可。 一、SPU 卡片索引层:知识库 2.0 的核心 改了什么:给每个物料编码(SPU)生成一张预聚合的标准答案卡(约 2KB JSON),把 AI 从"在 78,647 行长表里挑数"变成"读 1 张卡"。生产环境 23,743 张卡。 为什么改:RAG 的天花板是——能找文件、算不准数字。长表塞进上下文,模型挑数就像在电话簿里核对账单,看错行的概率永远不为零,而且错得理直气壮。我实测问过"铜管是不是涨价了",RAG 捞回几段话,一对原始数据,数字全错。 逻辑:四层分工,每层只干自己擅长的事: 1 2 3 4 5 6 7 8 9 ┌─────────────────────────────────────┐ │ L4 输出层 聚合报告(TOP10/预警/对标) │ ├─────────────────────────────────────┤ │ L3 分析层 粗筛→族归组→下钻(prompt链) │ ├─────────────────────────────────────┤ │ L2 索引层 SPU 卡片 × 23,743 │ ├─────────────────────────────────────┤ │ L1 数据层 行级明细 78,647 行(黄金源) │ └─────────────────────────────────────┘ 好处:铜管核查从 30-60 分钟人工透视压缩到 6 秒;上下文从全表 10.3MB 降到 59KB(-99.4%);每个数字带"数据行号"指针可一键回溯;结构性事实(5 个铜管编码全是同一家供应商)粗筛一眼可见——这是议价谈判里最值钱的信息,传统透视几乎发现不了。 ...

2026-08-31 · Gary
本地 AI 知识库架构图

从零搭建本地 AI 知识库:双索引 RAG 与自动化流水线(附可直接交给 AI 的完整代码)

你有没有这种经历:明明记得看过一篇文章,但搜遍了所有笔记都找不到? 或者:你有一个业务问题想问 AI,但 AI 给的答案和你的实际情况完全不搭——因为它根本不知道你的业务数据长什么样。 这不是 AI 的问题,是你没有给它一个能读懂的知识库。 市面上 60 多款知识库工具我都看过。Obsidian、Notion、SiYuan 这些笔记工具,上手快但检索只能关键词,AI 集成深度不够。Dify、RAGFlow、AnythingLLM 这些 AI 知识库工具,5 分钟能搭一个客服库,但数据格式私有、SaaS 不敢放业务数据、索引策略动不了。 我要说一个大多数人不同意的观点:知识库不是"存资料的仓库",而是"能帮你做判断的伙伴"。 如果你的知识库不能回答你自己的业务问题,它只是另一个收藏夹。真正的知识库应该能回答"某物料 A 与 B 供应商 2026 采购价格对比"这种具体问题——答案来自你自己的数据,不是 LLM 编造的。 本文拆解如何从零搭建一套数千文件、双索引 RAG、每日自动增量同步的本地 AI 知识库——一个业务管理者的"第二大脑"实战。文末附录包含一段可直接复制给任何 AI 助手的搭建指令和完整代码,让 AI 照着就能搭。 一、为什么不是 Obsidian / Notion / Dify? 市面上 60 多款工具我都看过。它们分为两类: 范式 代表 优点 致命缺陷(对我) 笔记工具 Obsidian、Notion、SiYuan 上手快、移动端好 检索只能关键词,AI 集成深度不够 AI 知识库工具 Dify、RAGFlow、AnythingLLM 5 分钟搭一个客服库 数据格式私有、SaaS 不敢放业务数据、EXCLUDE/重建策略动不了 我的核心约束是: 数据主权 100% 本地:大量采购明细、供应商档案、客户报价不能进任何 SaaS。 业务深度耦合:行业计价规则、多产品线结构、供应商画像,通用工具里都没有。 AI 召回可控:哪些文件进索引、哪些排除、表格文件如何聚合,必须由我定。 所以我没有选择「现成整机」,而是选择了自建范式:纯 Markdown + 自写脚本 + 本地向量索引 + 自动化流水线。 ...

2026-07-18 · Gary