今年早些时候,OpenAI创始成员安德烈·卡帕西(Andrej Karpathy)在GitHub发布了一篇代码片段。
项目名为「LLM Wiki」,全文约1500词。它提出了一种全新模式:搭建由大语言模型自主维护的个人知识库——这是一份可持久存储、持续累积迭代的知识载体,每一次新增内容都会让知识库变得更加完善。
知识只需整合一次并持续更新,无需每次提问都从零重新推导生成。
大多数人看完只会觉得“有点意思”,然后关掉页面,不了了之。
但我亲自落地实现了这套方案。本文将手把手教你搭建这套系统,并分享我在落地过程中总结的实战经验。
当下大众使用AI的普遍痛点
每一次AI对话,都是从零开始。
你打开对话窗口,反复介绍自己、当前的工作内容、上周敲定的决策,得到有用的回答后关闭页面。第二天,你又要重复一遍所有介绍。
AI工具本身没有问题,但底层长效上下文层完全缺失。
诚然,AI自带的基础记忆功能能起到一点作用。
Claude能记住你的姓名和职位,ChatGPT知道你偏好要点式回答。但它们都无法记住你正在推进的具体项目、即将敲定的合作、上个月淘汰的供应商、本周工作流程的进展细节。
这类动态、实时的工作状态,没有任何持久化的存储载体。
大多数工程师接下来的首选方案就是检索增强生成(RAG)。
RAG确实实用,但它解决的是完全不同的问题。
RAG的核心逻辑是每次提问都从零推导知识:对文档进行向量化嵌入,提问时检索相关片段,再拼凑作答。整个过程没有任何知识累积。
如果一个问题需要整合五份文档的信息,大语言模型每次提问都必须重新查找、拼接这些碎片化内容。
而本文介绍的「知识库仓库方案」,只需整合一次知识,持续迭代更新。每当你新增内容,大语言模型会自动索引、读取、整合信息,更新相关页面、标记内容冲突、维护交叉引用关系。
在你发起下一次提问前,知识的整合工作就已经完成了。
卡帕西对此有精准的概括:知识库是一份可持久、可累积迭代的长效载体。
交叉引用永久留存,分析结果不会随对话记录消失,而是持续沉淀、不断完善。
作者寄语:大家好,我是萨拉。我每周都会在Learn AI分享实用的AI落地搭建教程,涵盖工具用法、实战架构、生产环境常见问题,内容免费订阅。
核心架构:两个文件夹 + 一个配置规则文件
整套系统的核心结构仅需一个简单目录树即可实现:
vault/
├── CLAUDE.md # 规则配置文件,所有AI的入口文件
├── Raw/ # 原始只读源文档目录
│ ├── Meeting Notes/
│ ├── Documents/
│ └── _pending.md # 待编译任务队列
└── Wiki/ # AI生成、结构化、可索引的知识库
├── Projects/
├── People/
├── Decisions/
├── _hot.md # 实时核心缓存
├── _log.md # 操作审计日志
└── _index.md # 总索引目录
(以上为标准示例结构,可根据个人需求自定义调整)
Raw原始目录:唯一真实数据源
存放会议纪要、导出的Slack聊天记录、各类业务文档等一手工作资料。核心铁律:AI仅读取Raw目录内容,绝不修改、覆盖原始文件,仅支持追加记录。
Wiki知识库目录:AI自主搭建与维护的结构化知识层
按项目、人物、决策、业务领域分类生成独立文档,所有内容结构化整理、自动交叉引用。这是AI回答问题时优先读取的核心上下文。
熟悉数据管道的人能快速理解这套分层逻辑:Raw是原始数据落地层,Wiki是人工+AI整理后的精修层。若Wiki内容出现偏差或错乱,可基于Raw原始数据一键重建,永远不会丢失源头信息。
根目录的规则配置文件,用于告知AI整套知识库的组织结构、读取优先级和运行准则。适配Claude可命名为CLAUDE\.md,适配Codex可命名为AGENTS\.md。名称可自定义,只需保证每次对话会话启动时,AI优先读取该文件即可。
三大核心控制文件(系统稳定的关键)
绝大多数同类方案之所以最终失效,核心原因就是缺失这三个关键文件——单纯的Markdown文件夹无法形成可运转的系统,这三份文件才是整套自动化体系的核心。
1. _hot.md 实时缓存文件
每日自动化任务会更新该文件,汇总当前最新的工作进度、核心数据、截止时间和紧急事项,全文严格控制在500令牌以内。开启新对话时,AI会优先读取该文件,快速掌握最新动态,无需加载完整知识库,实现秒级上下文同步。
2. _pending.md 待处理队列文件
每当Raw目录新增文件,系统会自动将文件名、新增时间追加至该队列。每周的知识编译任务会读取该文件,逐一处理队列内容,将原始信息整合优化后录入Wiki知识库,并标记已编译状态。若无该队列文件,每日数据采集和每周知识整合会完全脱节,导致原始文件堆积、知识库长期滞后失效。
3. _log.md 审计日志文件
每一次自动化任务执行后,都会追加带时间戳的操作记录:任务类型、处理文件、新增/更新的Wiki页面。一旦知识库内容出现偏差,可通过日志精准定位问题环节。卡帕西在方案中给出了一个实用技巧:统一日志前缀格式,可直接通过Unix基础命令检索、解析日志内容。
示例日志格式:\#\# \[2026\-05\-01\] daily\-ingest
缺少这三份文件的知识库只会不断堆积冗余内容、逐渐失效;搭配三者,才能形成一套闭环、可迭代、可追溯的自动化知识管道。
规则配置文件:教会AI读懂你的专属知识库
CLAUDE\.md是整套系统的入口,所有AI对话会话都从读取该文件开始,包含以下核心配置:
目录结构说明:明确Raw、Wiki目录及所有子文件夹的用途
内容读取优先级:优先读取\_hot\.md,再读取对应领域的索引文档
硬性运行规则:禁止修改Raw原始文件、禁止编造源文件不存在的信息、每次任务结束必须追加审计日志等
你还可以在配置文件中固化专属提示词范式,我采用一套成熟通用的高效模板,直接嵌入规则文件:
我希望执行【具体任务】,最终达成【预期效果】。
1. 响应前完整读取所有上传文件;
2. 禁止直接执行任务,先向我提出澄清问题,协同优化执行方案;
3. 双方达成共识后,再启动正式工作。
”
将该逻辑固化到规则文件后,所有接入该知识库的AI都会默认先确认需求、再执行操作,彻底避免AI主观臆断导致的半成品输出。
值得固化的核心提示词理念
上下文优于指令:给AI投喂文件信息,而非单纯堆砌文字指令
示例优于规则描述:用实例展示预期效果,而非空洞的文字规定
约束优于条文:明确禁止事项,交由AI自主选择最优执行方式
目标优于步骤:明确最终达成的结果,不限制AI的执行细节
自动化分层机制:三段式定时任务(核心稳定性保障)
我见过两种典型的搭建失败案例:一是纯手动更新知识库,短期可用,长期因繁琐维护彻底停滞;二是将数据采集、知识整合、内容校验合并为一个自动化任务,导致每日增量更新错乱修改结构化知识库,引发内容污染。
最优解决方案是拆分三级自动化任务,各司其职、互不干扰。
1. 每日任务(工作日晨间):仅数据采集
同步各类工作工具的增量信息,新增文件存入Raw原始目录、录入待处理队列,更新实时缓存\_hot\.md。不修改任何Wiki结构化知识库内容。
每日任务流程机械、简单、安全,可无人值守自动运行。
实操提示词模板:
每个工作日晨间执行以下操作:
1. 检查项目管理工具近24小时新增、更新的任务内容;
2. 同步会议纪要源的新转录文档,以「年月日-会议主题.md」格式存入Raw/Meeting Notes目录,并更新_pending.md队列;
3. 读取团队沟通工具核心频道消息,提取决策结果、待办事项、项目相关关键信息;
4. 整理邮箱标记的重要邮件,汇总待处理事项。
完成后更新Wiki/_hot.md,仅保留:当日最新工作进度、核心数据、截止时间、紧急事项,全文控制在500令牌内。
”
可适配Linear、Slack、Notion、邮箱等各类工作工具,通用性极强。
2. 每周任务(周一晨间):知识整合编译
读取\_pending\.md待处理队列,逐一对原始文件进行解析整合,在对应领域目录生成结构化Wiki文档,更新全局索引、补充页面双向交叉引用,最后标记队列任务为已完成。
每周任务的核心是信息解读与知识结构化沉淀,运算量更大、成本更高,建议定期抽检,确保AI归档分类准确。
3. 每月任务(每月1日):合规巡检纠错
仅做健康检查,不修改任何知识库内容。全面扫描Wiki知识库,排查过期页面、缺失的交叉引用、内容冲突、信息盲区、无索引孤立文档,生成巡检报告并输出通俗版总结。
全程只读不写,零风险、无需人工值守,及时发现知识库隐性问题。
分层机制的核心逻辑
三级任务风险等级完全不同:每日任务纯机械采集、零风险;每周任务负责智能解读整合、中度风险;每月任务仅诊断不修改、无风险。三者拆分执行,彻底避免知识库错乱污染。
工具适配性:支持所有定时调度工具,可通过搭载MCP协议的命令行定时任务、n8n、AI桌面工具实现,调度载体可自由替换,核心逻辑通用。
落地后的核心改变
你无需反复向AI解释背景信息,对话模式彻底升级。
当长效上下文永久加载完成后,你不再局限于用AI解决零散小问题,而是真正用AI落地核心工作。
AI实时掌握你的在研项目、近期决策、团队动态。当你提问「今天的工作优先级是什么」时,AI会结合实时缓存与完整项目知识库,给出贴合你实际工作场景的落地答案,而非通用套话。
另一大核心优势:高可移植性
你的所有上下文存储在本地文件夹,而非绑定某款AI的云端记忆。只需将该知识库目录指向其他AI工具,即可无缝同步全部知识,随时自由切换AI平台,知识库完全随行可用。
落地必看的常见故障与规避方案
任务队列堆积:每日采集范围过广,每周整合任务处理不及时。解决方案:精简每日采集规则,仅同步核心有效信息。
知识库内容偏差:长期不查看审计日志,问题无法及时发现。解决方案:定期查阅月度巡检报告与\_log\.md日志。
系统彻底崩溃:自动化任务修改Raw原始文件,破坏唯一真实数据源。核心铁律:绝对禁止任何程序、任务修改原始目录文件,该边界不可突破。
结语
维护知识库最繁琐的工作,从来不是阅读与思考,而是机械的台账维护:更新交叉引用、同步最新摘要、比对新旧内容冲突。人类会因繁重的维护成本放弃知识库,但大语言模型不会疲惫、不会遗漏、可一次性批量更新十余份文档。
卡帕西的这套方案,溯源至1945年万尼瓦尔·布什(Vannevar Bush)提出的「记忆拓展器(Memex)」概念——一套个人专属的精选知识库,文档间具备关联检索能力。这一超前构想远比当下的互联网形态更贴合AI知识库,当年无法解决的持续维护难题,如今可由大语言模型完美落地。
我目前落地的方案,以Claude作为AI算力层、轻量化Markdown工具作为前端展示层,稳定可用。
这套架构兼容所有可读取本地文件的AI、所有定时调度工具。本质只是普通文件夹与文本文件,无复杂封装。
一次搭建、永久受用,让你的AI对话彻底告别从零开始,拥有持续迭代、无限更新的专属长效上下文。
推荐学习书籍 《CDA一级教材》适合CDA一级考生备考,也适合业务及数据分析岗位的从业者提升自我。完整电子版已上线CDA网校,累计已有10万+在读~ !