← 内容专区
内容专区 › 每日AI情报 · 大V Karpathy · ①

Karpathy 的 LLM 个人知识库工作流

作者 追光 日期 2026-08-27 来源 @karpathy · 2026-04-03
Karpathy知识库工作流🔖 收藏 10.8 万

核心观点:让 LLM"编译"你的知识

Andrej Karpathy 最近很受用的一套方法:用 LLM 来构建个人知识库。他把大量 token 吞吐从"操作代码"转向"操作知识"(以 markdown 和图片形式存储)。核心做法是把一堆零散资料交给 LLM,让它增量式地"编译"成一个 wiki。

五步工作流

① 数据摄入(ingest):把文章、论文、仓库、数据集、图片索引进 raw/ 目录,用 Obsidian Web Clipper 把网页转 .md,热键批量下载相关图片供 LLM 引用。

② 编译 wiki:LLM 增量式把 raw/ 编译成目录结构下的 .md 文件集合——含所有数据摘要、反向链接,并归类成概念、撰写条目、互相链接。wiki 里的数据几乎全由 LLM 维护,本人很少手动改。

③ IDE:用 Obsidian 当"前端",查看 raw 数据、编译后的 wiki 和派生可视化。

④ Q&A:wiki 够大后(比如他的研究主题约 100 篇文章、40 万字),可以让 LLM agent 基于 wiki 回答各种复杂问题。他原本以为要用花哨的 RAG,结果 LLM 自动维护索引和摘要,小规模下直接读关联数据就够用了。

⑤ 输出 & 归档:答案不只返回文本,LLM 会渲染成 markdown 文件、幻灯片(Marp)或 matplotlib 图片,看完再"归档"回 wiki 增强后续查询——每次探索都会积累进知识库

额外工具与健康检查

Karpathy 还会跑 LLM 对 wiki 做"健康检查":找不一致数据、用联网搜索补全缺失信息、发现可写新条目的关联,增量清理、提升数据完整性。另外他"vibe coding"了一个轻量自建搜索引擎,既自己用,也作为 CLI 工具交给 LLM 应对更大查询。

Karpathy 观点:这个领域有潜力做出一个优秀的新产品,而不只是一堆临时脚本的拼凑。

追光点评

这是三条里最适合照抄落地的一条。投入产出比极高——不需要复杂 RAG 架构,Obsidian + 现代 LLM 就够跑通

关键洞察是"知识也值得被编译":像代码要编译一样,散落的资料经 LLM 结构化后,检索和推理效率都上一个台阶,且持续累积。

对国内用户:这思路可复用到任何笔记/科研/项目资料管理场景,值得收藏实践。