由你掌控的第二大脑:基于 Raspberry Pi 5 的本地 RAG

由你掌控的第二大脑:基于 Raspberry Pi 5 的本地 RAG

构建一个完全私密且无法被传唤调取数据的检索系统

一个真正属于你的大脑

如果你的第二大脑无法被传唤调取,会怎样?目前,如果你使用基于云端的笔记应用、向量数据库或 AI 助手来拓展思维,那么控制访问权限的是其他人。今天,我们将探讨如何构建一个不受他人控制的系统。

2026 年 7 月 5 日,一篇详细指南发布,展示了如何完全在 Raspberry Pi 5 上运行一套完整的检索系统——无需云端服务,无需 API keys,无需第三方监视。这在当下至关重要,因为我们已经集体将工作记忆转移到了拥有法务部门、服务条款以及回应执法部门的速度比你回复邮件还快的平台中。

为什么你的云端大脑是租来的,而不是拥有的

早在 1998 年,哲学家 Andy Clark 和 David Chalmers 就提出了“延展心灵”(extended mind)的概念。他们的观点很直接:如果你可靠地使用某种工具来辅助思考——无论是笔记本、数据库还是你信任的系统——该工具就会成为你认知的一部分。你不只是在查阅它;你是在 用它来思考.

当你的延展心灵保存在你抽屉里的纸张上时,这没有任何问题。但把它移到云端后,就出现了三个问题:

认知污染。 当你的搜索数据被用来训练商业 AI 模型时,你未来获得的答案就会受到其他所有人查询的影响。你的私密上下文便稀释成了中位数用户的上下文。

法律风险。 你的搜索历史、笔记、embeddings——你思考的所有原始素材——都会变成可被调查取证的商业记录。在许多司法管辖区,平台可能会被强制交出这些数据。

战略脆弱性。 一次涨价、一次政策调整或一次地区封锁,你的认知工具就荡然无存。那不再是工具——而是一种依赖。

本地检索彻底改变了这一局面。

RAG 究竟是什么(以及为什么它优于 Fine-Tuning)

RAG 代表检索增强生成(Retrieval Augmented Generation)。与将知识强行写入模型权重(既昂贵又难以更新)不同,RAG 将你的知识独立保存,并在查询时实时提取——就像需要时在图书馆查找一本书,而不是背下每本书。

对于个人大脑而言,这之所以重要有四个原因:

可追溯性。 RAG 可以精准展示它提取自哪篇笔记或文档。而经过 fine-tuned 的模型则会一本正经地胡说八道且毫无引用出处。

可变性。 你的生活每天都在改变。更新一篇笔记,重新生成 embedding,你的答案就会反映最新现实。而经过 fine-tuned 的模型需要昂贵的重新训练,否则就只能提供陈旧的知识。

可组合性。 按日期、标签或文档类型进行筛选。“仅显示 2024 年的工作笔记”并非粗暴的替代方案——而是作为选择性解压缩的检索过程。

便携性。 一个 2GB 的 vector store 加上一个小型量化模型就可以装进 Pi 中。而一个效果不差的真正 fine-tuned 模型却做不到。

这个构想并不新鲜——早在数十年前,Vannevar Bush 就已经在其 Memex 概念中设想了穿梭于信息之间的“关联路径”(associative trails)。如今我们终于拥有了构建它们的数学工具。

硬件:便携式大脑

配备 NVMe 存储的 Raspberry Pi 5 是实现这一目标的关键。早期版本 Pi 的检索速度太慢。Pi 5 通过其 HAT 接口引出了 PCIe,为你带来了真正的存储带宽——而这正是 RAG 系统的实际瓶颈。

一个完整的构建配置如下:

  • Raspberry Pi 5 配备 8GB RAM
  • NVMe HAT (如 Pineberry Pi HatDrive)搭配 1TB 高速存储,优先选择带有 DRAM 缓存的 TLC
  • Hailo-8 M.2 AI module (仅需 2.5 瓦即可提供 26 TOPS 算力)以卸载 embedding 计算
  • 被动散热铝合金外壳 兼作散热器
  • USB-C PD 移动电源 (65W)以保证便携性
  • 两张 microSD 卡 ——一张用于 Bootloader,一张用于加密备份

整套设备待机功耗为 4 至 6 瓦,负载下功耗为 9 至 12 瓦。一个 20,000 mAh 的移动电源就能让它全天运行。关键就在于:一个无法随身携带的大脑,是一个你不会去使用的大脑。

软件栈(故意保持极简)

臃肿会破坏可审计性。整个系统通过 Docker Compose 编排并运行四个容器:

  1. Qdrant ——用 Rust 编写的 vector database。它十分轻量,可在 ARM 上运行,并且相比纯粹的性能速度,它能更好地处理元数据过滤。

  2. Ollama ——用于提供量化语言模型服务。配备 8GB 内存的 Pi 5 的最佳选择是 llama3.1:8b-instruct-q4_K_M。它足够小巧可以装下,又足够强大可以撰写实际文本。

  3. Nomic Embed Text v1.5 ——将你的文本转化为向量的 embedding 模型。它体量紧凑,召回率表现优异,并且能在 ARM 处理器上平稳运行。

  4. FastAPI 服务器 (约 180 行 Python 代码)将一切黏合在一起:摄取文档、检索匹配项、构建 prompt、调用模型并返回答案。

没有 LangChain。没有隐藏 prompt 构建逻辑的“神奇链”。你能看清偏见,因为你能看到模板本身。

如何正确摄取知识

分块(Chunking)至关重要。系统将 Markdown 文件按 700 至 900 个 tokens 切分,块与块之间保留 100 至 150 个 tokens 的重叠。这种重叠保留了跨越边界的上下文——边缘处的词语不会与前文割裂开来。

对于代码,它使用 tree-sitter(一种能感知语法结构的解析器)按函数或类进行分块,并将语言和符号名称存储为元数据。

对于 PDF,它在本地运行 OCR,按标题分块,并保留页码以便你查找原文。

它会计算源文件的 SHA256 哈希值。当你重新摄取时,未修改的文件会自动跳过处理——极其智能且高效。

检索:获取真正的答案

当你提出问题时:

  1. 系统会将你的查询嵌入(embed)为向量。
  2. 它会在 Qdrant 中搜索相似度最高的前 12 个块。
  3. 它会应用多样性重排序(最大边际相关性/maximal marginal relevance),从而让你获得不同的视角,而不仅仅是同一个观点的 12 个版本。
  4. 如果你的问题暗示了标签或日期,它会据此进行过滤。

快速的错误答案比缓慢的正确答案更糟糕。该系统将正确性置于速度之上。

安全与隐私

使用 LUKS2 和 Argon2id(而非 PBKDF2)加密 NVMe。将密钥文件保存在引导后即物理拔出的 USB 驱动器上,或牢记一个强密码短语。挂载数据分区时使用 noexec 和 nodev 标志,使代码无法从中运行。

将操作系统保留在只读覆盖层(read-only overlay)上,这样突发断电就不会损坏你的根文件系统。

这并非被迫害妄想。你是在构建一个认知装备,而不是一个业余玩闹的项目。这些数据就是你的思考本身。

结语

延展心灵是真实存在的。你的工具塑造着你的思想。几十年来,我们为了便利放弃了所有权,将工作记忆托管在那些致力于监控和数据挖掘的平台上。你可以重新夺回它——凭着耐心和一些硬件搭建,你的第二大脑就可以完全属于你一个人,离线、快速且真正私密。

优点

  • 完全私密:无云端,无第三方访问,无数据可被传唤调取。
  • 掌控完整技术栈:查看每一行代码,理解每一个决策。
  • 便携且低功耗:依靠电池即可全天运行。
  • 准确:RAG 引用来源可让你核实出处并避免幻觉。
  • 可更新:无需重新训练即可添加新知识。
  • 完全离线工作:没有 API 速率限制,没有等待云端的延迟。

缺点

  • 需要技术门槛设置:无法一键即用。
  • 推理发生在设备硬件上:无法做到即时响应。
  • 模型质量与超大型云端模型相比存在局限。
  • 维护需亲力亲为:更新、安全补丁以及硬件故障都需要你自己负责。
  • 知识库容量有限:受限于 Pi 的存储空间(尽管 1TB 对于个人使用而言已非常充裕)。

注意事项

本文仅供教育参考,总结自公开信息。如果你构建此系统,请将所有示例值替换为你自己的配置。在将系统用于关键任务之前,请结合原始出处核实所有技术声明并进行彻底测试。如果你的威胁模型较为严峻,安全性(尤其是加密)应由具备密码学专业知识的人员进行验证。本文不构成安全建议。

常见问题解答

  • 对于个人知识系统而言,RAG 和 fine-tuning 之间有什么区别?
  • Raspberry Pi 5 真的能在离线状态下运行完整的 AI 检索系统吗?
  • 1TB 的 Pi 硬盘能存储多少知识?
  • 即使采用完全本地化的搭建,还存在哪些隐私风险?
  • 你能在多台设备之间安全地同步你的个人大脑吗?
  • 搭建此系统需要哪些编程技能?
  • 这种方法比使用云端笔记应用更好吗?
  • 带有备用电池的 Raspberry Pi 系统便携性如何?

标签

#privacy #raspberrypi #rag #ai #offline #security #locallm #personalknowledge

Free field guide

Incident Response: First Hour

A calm, evidence-preserving checklist for establishing control, bounding impact, communicating clearly, and containing an incident safely.