🎧 Listen to this article: हिंदी · English · தமிழ் · తెలుగు · ಕನ್ನಡ · മലയാളം · ଓଡ଼ିଆ · 日本語 · 中文
🌍 Read this in your language: हिंदी · தமிழ் · తెలుగు · ಕನ್ನಡ · മലയാളം · ଓଡ଼ିଆ · 日本語 · 中文
一个真正属于你的大脑
如果你的第二大脑无法被传唤调取,会怎样?目前,如果你使用基于云端的笔记应用、向量数据库或 AI 助手来拓展思维,那么控制访问权限的是其他人。今天,我们将探讨如何构建一个不受他人控制的系统。
2026 年 7 月 5 日,一篇详细指南发布,展示了如何完全在 Raspberry Pi 5 上运行一套完整的检索系统——无需云端服务,无需 API keys,无需第三方监视。这在当下至关重要,因为我们已经集体将工作记忆转移到了拥有法务部门、服务条款以及回应执法部门的速度比你回复邮件还快的平台中。
为什么你的云端大脑是租来的,而不是拥有的
早在 1998 年,哲学家 Andy Clark 和 David Chalmers 就提出了“延展心灵”(extended mind)的概念。他们的观点很直接:如果你可靠地使用某种工具来辅助思考——无论是笔记本、数据库还是你信任的系统——该工具就会成为你认知的一部分。你不只是在查阅它;你是在 用它来思考.
当你的延展心灵保存在你抽屉里的纸张上时,这没有任何问题。但把它移到云端后,就出现了三个问题:
认知污染。 当你的搜索数据被用来训练商业 AI 模型时,你未来获得的答案就会受到其他所有人查询的影响。你的私密上下文便稀释成了中位数用户的上下文。
法律风险。 你的搜索历史、笔记、embeddings——你思考的所有原始素材——都会变成可被调查取证的商业记录。在许多司法管辖区,平台可能会被强制交出这些数据。
战略脆弱性。 一次涨价、一次政策调整或一次地区封锁,你的认知工具就荡然无存。那不再是工具——而是一种依赖。
本地检索彻底改变了这一局面。
RAG 究竟是什么(以及为什么它优于 Fine-Tuning)
RAG 代表检索增强生成(Retrieval Augmented Generation)。与将知识强行写入模型权重(既昂贵又难以更新)不同,RAG 将你的知识独立保存,并在查询时实时提取——就像需要时在图书馆查找一本书,而不是背下每本书。
对于个人大脑而言,这之所以重要有四个原因:
可追溯性。 RAG 可以精准展示它提取自哪篇笔记或文档。而经过 fine-tuned 的模型则会一本正经地胡说八道且毫无引用出处。
可变性。 你的生活每天都在改变。更新一篇笔记,重新生成 embedding,你的答案就会反映最新现实。而经过 fine-tuned 的模型需要昂贵的重新训练,否则就只能提供陈旧的知识。
可组合性。 按日期、标签或文档类型进行筛选。“仅显示 2024 年的工作笔记”并非粗暴的替代方案——而是作为选择性解压缩的检索过程。
便携性。 一个 2GB 的 vector store 加上一个小型量化模型就可以装进 Pi 中。而一个效果不差的真正 fine-tuned 模型却做不到。
这个构想并不新鲜——早在数十年前,Vannevar Bush 就已经在其 Memex 概念中设想了穿梭于信息之间的“关联路径”(associative trails)。如今我们终于拥有了构建它们的数学工具。
硬件:便携式大脑
配备 NVMe 存储的 Raspberry Pi 5 是实现这一目标的关键。早期版本 Pi 的检索速度太慢。Pi 5 通过其 HAT 接口引出了 PCIe,为你带来了真正的存储带宽——而这正是 RAG 系统的实际瓶颈。
一个完整的构建配置如下:
- Raspberry Pi 5 配备 8GB RAM
- NVMe HAT (如 Pineberry Pi HatDrive)搭配 1TB 高速存储,优先选择带有 DRAM 缓存的 TLC
- Hailo-8 M.2 AI module (仅需 2.5 瓦即可提供 26 TOPS 算力)以卸载 embedding 计算
- 被动散热铝合金外壳 兼作散热器
- USB-C PD 移动电源 (65W)以保证便携性
- 两张 microSD 卡 ——一张用于 Bootloader,一张用于加密备份
整套设备待机功耗为 4 至 6 瓦,负载下功耗为 9 至 12 瓦。一个 20,000 mAh 的移动电源就能让它全天运行。关键就在于:一个无法随身携带的大脑,是一个你不会去使用的大脑。
软件栈(故意保持极简)
臃肿会破坏可审计性。整个系统通过 Docker Compose 编排并运行四个容器:
-
Qdrant ——用 Rust 编写的 vector database。它十分轻量,可在 ARM 上运行,并且相比纯粹的性能速度,它能更好地处理元数据过滤。
-
Ollama ——用于提供量化语言模型服务。配备 8GB 内存的 Pi 5 的最佳选择是 llama3.1:8b-instruct-q4_K_M。它足够小巧可以装下,又足够强大可以撰写实际文本。
-
Nomic Embed Text v1.5 ——将你的文本转化为向量的 embedding 模型。它体量紧凑,召回率表现优异,并且能在 ARM 处理器上平稳运行。
-
FastAPI 服务器 (约 180 行 Python 代码)将一切黏合在一起:摄取文档、检索匹配项、构建 prompt、调用模型并返回答案。
没有 LangChain。没有隐藏 prompt 构建逻辑的“神奇链”。你能看清偏见,因为你能看到模板本身。
如何正确摄取知识
分块(Chunking)至关重要。系统将 Markdown 文件按 700 至 900 个 tokens 切分,块与块之间保留 100 至 150 个 tokens 的重叠。这种重叠保留了跨越边界的上下文——边缘处的词语不会与前文割裂开来。
对于代码,它使用 tree-sitter(一种能感知语法结构的解析器)按函数或类进行分块,并将语言和符号名称存储为元数据。
对于 PDF,它在本地运行 OCR,按标题分块,并保留页码以便你查找原文。
它会计算源文件的 SHA256 哈希值。当你重新摄取时,未修改的文件会自动跳过处理——极其智能且高效。
检索:获取真正的答案
当你提出问题时:
- 系统会将你的查询嵌入(embed)为向量。
- 它会在 Qdrant 中搜索相似度最高的前 12 个块。
- 它会应用多样性重排序(最大边际相关性/maximal marginal relevance),从而让你获得不同的视角,而不仅仅是同一个观点的 12 个版本。
- 如果你的问题暗示了标签或日期,它会据此进行过滤。
快速的错误答案比缓慢的正确答案更糟糕。该系统将正确性置于速度之上。
安全与隐私
使用 LUKS2 和 Argon2id(而非 PBKDF2)加密 NVMe。将密钥文件保存在引导后即物理拔出的 USB 驱动器上,或牢记一个强密码短语。挂载数据分区时使用 noexec 和 nodev 标志,使代码无法从中运行。
将操作系统保留在只读覆盖层(read-only overlay)上,这样突发断电就不会损坏你的根文件系统。
这并非被迫害妄想。你是在构建一个认知装备,而不是一个业余玩闹的项目。这些数据就是你的思考本身。
结语
延展心灵是真实存在的。你的工具塑造着你的思想。几十年来,我们为了便利放弃了所有权,将工作记忆托管在那些致力于监控和数据挖掘的平台上。你可以重新夺回它——凭着耐心和一些硬件搭建,你的第二大脑就可以完全属于你一个人,离线、快速且真正私密。
优点
- 完全私密:无云端,无第三方访问,无数据可被传唤调取。
- 掌控完整技术栈:查看每一行代码,理解每一个决策。
- 便携且低功耗:依靠电池即可全天运行。
- 准确:RAG 引用来源可让你核实出处并避免幻觉。
- 可更新:无需重新训练即可添加新知识。
- 完全离线工作:没有 API 速率限制,没有等待云端的延迟。
缺点
- 需要技术门槛设置:无法一键即用。
- 推理发生在设备硬件上:无法做到即时响应。
- 模型质量与超大型云端模型相比存在局限。
- 维护需亲力亲为:更新、安全补丁以及硬件故障都需要你自己负责。
- 知识库容量有限:受限于 Pi 的存储空间(尽管 1TB 对于个人使用而言已非常充裕)。
注意事项
本文仅供教育参考,总结自公开信息。如果你构建此系统,请将所有示例值替换为你自己的配置。在将系统用于关键任务之前,请结合原始出处核实所有技术声明并进行彻底测试。如果你的威胁模型较为严峻,安全性(尤其是加密)应由具备密码学专业知识的人员进行验证。本文不构成安全建议。
常见问题解答
- 对于个人知识系统而言,RAG 和 fine-tuning 之间有什么区别?
- Raspberry Pi 5 真的能在离线状态下运行完整的 AI 检索系统吗?
- 1TB 的 Pi 硬盘能存储多少知识?
- 即使采用完全本地化的搭建,还存在哪些隐私风险?
- 你能在多台设备之间安全地同步你的个人大脑吗?
- 搭建此系统需要哪些编程技能?
- 这种方法比使用云端笔记应用更好吗?
- 带有备用电池的 Raspberry Pi 系统便携性如何?
标签
#privacy #raspberrypi #rag #ai #offline #security #locallm #personalknowledge
Incident Response: First Hour
A calm, evidence-preserving checklist for establishing control, bounding impact, communicating clearly, and containing an incident safely.
Free. No spam — unsubscribe in one click.


Responses
Sign in to leave a response.