个人知识库搭建指南:从Obsidian到AI检索
2026-09-28
个人知识库搭建指南:从Obsidian到AI检索
我大概是从2021年开始用Obsidian的。那会儿刚换工作,每天要处理的技术文档、会议记录、临时灵感一大堆,散落在微信收藏、Notion、备忘录里,找起来跟考古似的。后来接触到Obsidian的本地Markdown双链,才算是把知识管理这件事真正跑起来了。
到现在我的库里有3800多篇笔记,累计大概200多万字。但说实话,真正让我觉得"第二大脑"这个概念落地的,不是笔记数量,而是去年开始把AI检索接进工作流之后。今天就把这套从Obsidian到AI检索的搭建过程完整讲一遍。
为什么选Obsidian做底座
市面上笔记工具很多,我挑Obsidian的核心原因就一个:笔记是我自己的本地文件,格式是纯Markdown,不绑定任何云服务。这点在接AI的时候特别重要,因为我可以直接把整个文件夹喂给本地的脚本或者大模型,不用担心API导出限制。
Notion、飞书这些当然也好用,但它们的数据库结构是封闭的,你想批量做语义检索,得走官方API,速度慢还容易限流。Obsidian的库本质上就是一个文件夹,vault/下面全是.md文件,随便你怎么折腾。
我的库结构大致是这样:
vault/
├── 00-Inbox/ # 临时收集
├── 10-Notes/ # 常青笔记
├── 20-Projects/ # 项目文档
├── 30-Reading/ # 读书笔记
├── 40-Daily/ # 日记
└── 90-Attachments/ # 图片附件
这套数字前缀是跟Nick Milo的LYT方法学的,好处是文件夹排序稳定,不用手动拖。
双链和标签,别贪多
新手最容易犯的错是把双链和标签当成KPI。我早期也是这样,一篇笔记恨不得连十几个[[link]],结果图谱看起来像蜘蛛网,实际检索时反而找不到东西。
后来我给自己定了个规则:双链只在"这两篇笔记确实有逻辑关联"时用,标签只保留两层结构,比如#tech/obsidian、#reading/2024。数量控制在50个以内,多了就合并。
真正让知识库"活"起来的其实是索引笔记(MOC)。我每个主题都会维护一篇MOC,比如Obsidian使用MOC.md,里面手动整理这个主题下最重要的10-20篇笔记链接。这比自动图谱有用得多。
从笔记到AI检索,中间缺了什么
Obsidian自带的搜索是关键词匹配,你搜"向量数据库"只能找到字面包含这个词的笔记。但我笔记里可能写的是"embedding存储方案"、"Pinecone实践",这些语义相关的内容就漏了。
这就是需要AI检索的地方。我的方案分两层:
| 层级 | 工具 | 作用 | 成本 |
|---|---|---|---|
| 第一层 | Obsidian内置搜索 + Omnisearch插件 | 关键词精确查找 | 免费 |
| 第二层 | 本地向量库 + 大模型 | 语义检索、问答 | 几乎为零 |
第一层不用多说,Omnisearch比自带搜索强在支持模糊匹配和PDF内容。第二层才是重点。
具体怎么搭语义检索
我用的是Smart Connections这个Obsidian插件,它会在本地用一个小型embedding模型(默认是TaylorAI/bge-micro-v2,只有17MB)给所有笔记生成向量,然后存在本地。整个过程不需要联网,隐私没问题。
装好之后的体验是这样的:我打开一篇关于RAG的笔记,右侧栏会自动列出"相关笔记",经常能翻出我自己都忘了写过的内容。有次写方案卡壳,它给我推了一篇两年前记的会议纪要,里面正好有个类似场景的解决思路。
如果你想要更强的问答能力,可以再往上叠一层。我的做法是用Ollama跑本地模型(qwen2.5:7b够用了),配合AnythingLLM或者自己写个Python脚本,把Obsidian库作为知识源。这样就能实现"用我自己的笔记回答问题"。
大概的流程是:
- 用
python-frontmatter遍历vault,提取每篇笔记的正文 - 按标题层级切块,每块500字左右,重叠100字
- 用
sentence-transformers生成向量,存进ChromaDB - 提问时先检索Top 5相关块,拼进prompt丢给本地模型
这套跑下来,在一台16G内存的MacBook Air上完全够用,检索延迟大概1-2秒。
一些踩过的坑
别一上来就全库向量化。我一开始把3800篇全塞进去,结果检索质量反而下降,因为日记、剪藏这些噪音太多。后来我只向量化10-Notes和20-Projects两个文件夹,大概1200篇,效果好很多。
笔记标题要写人话。早期我喜欢用"2023-05-12"这种日期做标题,AI检索时根本不知道这篇讲什么。现在我的规则是标题必须包含核心概念,比如"RAG检索增强生成的三种切块策略"。
定期清理比什么都重要。我每个月会花半小时过一遍Inbox,该删的删,该合并的合并。知识库不是仓库,堆多了只会拖慢检索。
现在的工作流长什么样
早上写日记,随手记灵感到Inbox。白天遇到问题,先在自己的库里搜一遍,80%的情况能找到之前的思考。写新笔记时,Smart Connections会提示相关旧笔记,避免重复造轮子。周末整理一次,把Inbox里的内容归位,更新对应的MOC。
这套流程跑了快一年,最大的感受是:知识库的价值不在于存了多少,而在于你能不能随时调用出来。Obsidian解决了"存"的问题,AI检索解决了"取"的问题,两个拼起来,第二大脑才算是真的能用了。
如果你现在还在用文件夹+关键词搜索,不妨先装个Smart Connections试试,成本几乎为零,但体验提升是立竿见影的。等用顺了,再考虑往上叠本地大模型那一层。