एक दूसरा मस्तिष्क जिसे आप नियंत्रित करते हैं: Raspberry Pi 5 पर लोकल RAG

एक दूसरा मस्तिष्क जिसे आप नियंत्रित करते हैं: Raspberry Pi 5 पर लोकल RAG

एक पूरी तरह से निजी रिट्रीवल सिस्टम बनाएं जिसे कोई भी सम्मन (subpoena) के जरिए ज़ब्त या तलब न कर सके

एक ऐसा मस्तिष्क जिसके स्वामी आप स्वयं हो सकते हैं

क्या हो अगर आपके दूसरे मस्तिष्क को कानूनन तलब (subpoena) न किया जा सके? इस समय, यदि आप अपनी सोच का विस्तार करने के लिए क्लाउड-आधारित नोट-टेकिंग, वेक्टर डेटाबेस या AI सहायकों का उपयोग करते हैं, तो उस एक्सेस को कोई और नियंत्रित करता है। आज, हम एक्सप्लोर करेंगे कि एक ऐसा सिस्टम कैसे बनाया जाए जिसमें ऐसा न हो।

5 जुलाई, 2026 को एक विस्तृत गाइड आई जिसमें ठीक यह दिखाया गया कि Raspberry Pi 5 पर एक पूरा रिट्रीवल सिस्टम कैसे चलाएं — बिना किसी क्लाउड सेवा, बिना API कुंजी और बिना किसी तीसरे पक्ष की निगरानी के। यह अब इसलिए मायने रखता है क्योंकि हमने सामूहिक रूप से अपनी वर्किंग मेमोरी को ऐसे प्लेटफार्मों में स्थानांतरित कर दिया है जिनके पास कानूनी विभाग, सेवा की शर्तें (terms of service) और ऐसी टीमें हैं जो आपके ईमेल का उत्तर देने की तुलना में कानून प्रवर्तन एजेंसियों को अधिक तेज़ी से जवाब देती हैं।

आपका क्लाउड ब्रेन लीज़ पर क्यों है, आपका अपना क्यों नहीं

दार्शनिकों Andy Clark और David Chalmers ने 1998 में "extended mind" की अवधारणा पेश की थी। उनका तर्क सीधा था: यदि आप सोचने के लिए किसी उपकरण का नियमित रूप से उपयोग करते हैं — एक नोटबुक, एक डेटाबेस, या कोई ऐसा सिस्टम जिस पर आप भरोसा करते हैं — तो वह उपकरण आपके संज्ञान (cognition) का हिस्सा बन जाता है। आप केवल उससे परामर्श नहीं करते; आप उसके साथ सोचते हैं.

यह तब तक ठीक था जब तक आपका extended mind आपके स्वामित्व वाली दराज में कागज पर रहता था। लेकिन इसे क्लाउड पर ले जाइए, और तीन समस्याएं सामने आती हैं:

ज्ञानात्मक प्रदूषण (Epistemic pollution)। जब आपकी खोजें (searches) वाणिज्यिक AI मॉडल को प्रशिक्षित करती हैं, तो आपके भावी उत्तर बाकी सभी के प्रश्नों से आकार लेते हैं। आपका निजी संदर्भ (private context) औसत उपयोगकर्ता के संदर्भ में घुलकर कमजोर हो जाता है।

कानूनी जोखिम (Legal exposure)। आपकी खोज का इतिहास, आपके नोट्स, आपके एम्बेडिंग्स — आपकी सोच का सारा कच्चा माल — प्रकटीकरण योग्य व्यावसायिक रिकॉर्ड (discoverable business records) बन जाते हैं। कई क्षेत्राधिकारों में, किसी प्लेटफ़ॉर्म को उन्हें सौंपने के लिए बाध्य किया जा सकता है।

रणनीतिक नाजुकता (Strategic fragility)। कीमतों में वृद्धि, नीति में बदलाव, या रीजन ब्लॉक, और आपका संज्ञानात्मक उपकरण गायब हो जाता है। वह अब कोई उपकरण नहीं रह जाता — वह एक निर्भरता बन जाता है।

लोकल रिट्रीवल इस पूरी स्थिति को बदल देता है।

RAG वास्तव में क्या है (और यह Fine-Tuning से बेहतर क्यों है)

RAG का अर्थ Retrieval Augmented Generation है। ज्ञान को किसी मॉडल के भार (weights) में शामिल करने के बजाय (जो महंगा है और जिसे अपडेट करना कठिन है), RAG आपके ज्ञान को अलग रखता है और प्रश्न (query) के समय इसे प्राप्त करता है — जैसे आवश्यकता पड़ने पर अपनी लाइब्रेरी में किसी पुस्तक को देखना, न कि हर पुस्तक को याद करना।

व्यक्तिगत मस्तिष्क के लिए, यह चार कारणों से मायने रखता है:

उत्पत्ति का प्रमाण (Provenance)। RAG आपको ठीक-ठीक दिखा सकता है कि उसने किस नोट या दस्तावेज़ से जानकारी निकाली है। फाइन-ट्यून किए गए मॉडल बिना किसी उद्धरण के आत्मविश्वास से भ्रमित करने वाली जानकारी (hallucinate) देते हैं।

परिवर्तनीयता (Mutability)। आपका जीवन रोज बदलता है। एक नोट अपडेट करें, उसे फिर से एम्बेड (re-embed) करें, और आपके उत्तर वास्तविकता को दर्शाएंगे। फाइन-ट्यून किए गए मॉडलों को महंगे पुनर्रशिक्षण (retraining) की आवश्यकता होती है या वे आपको बासी ज्ञान प्रदान करते हैं।

संयोजन क्षमता (Composability)। तिथि, टैग, या दस्तावेज़ प्रकार के अनुसार फ़िल्टर करें। "मुझे केवल 2024 के कार्य संबंधी नोट्स दिखाएं" कोई हैक नहीं है — यह चयनात्मक डिकंप्रेशन (selective decompression) के रूप में रिट्रीवल है।

सुवाह्यता (Portability)। 2GB का वेक्टर स्टोर और एक छोटा क्वांटाइज्ड मॉडल एक Pi पर समा जाता है। एक वास्तविक फाइन-ट्यून किया गया मॉडल जो खराब न हो, वह इसमें नहीं समाता।

यह विचार नया नहीं है — Vannevar Bush ने दशकों पहले अपनी Memex अवधारणा में जानकारी के माध्यम से "associative trails" की कल्पना की थी। हमारे पास आखिरकार उन्हें बनाने के लिए गणित उपलब्ध है।

हार्डवेयर: एक पोर्टेबल मस्तिष्क

NVMe स्टोरेज वाला Raspberry Pi 5 यहाँ मुख्य प्रवर्तक (key enabler) है। पहले के Pi रिट्रीवल में बहुत धीमे थे। Pi 5 अपने HAT कनेक्टर के माध्यम से PCIe को एक्सपोज़ करता है, जिससे आपको वास्तविक स्टोरेज बैंडविड्थ मिलती है — जो RAG सिस्टम के लिए वास्तविक बाधा (bottleneck) है।

एक पूरा बिल्ड इस तरह दिखता है:

  • Raspberry Pi 5 8GB RAM के साथ
  • NVMe HAT 1TB तेज़ स्टोरेज के साथ (जैसे Pineberry Pi HatDrive), DRAM कैश के साथ TLC को प्राथमिकता दी जाती है
  • Hailo-8 M.2 AI मॉड्यूल एम्बेडिंग गणित के बोझ को ऑफलोड करने के लिए (मात्र 2.5 वॉट पर 26 TOPS)
  • पैसिव एल्यूमीनियम केस जो हीट्सिंक के रूप में भी काम करता है
  • USB-C PD बैटरी बैंक पोर्टेबिलिटी के लिए (65W)
  • दो microSD कार्ड — एक बूटलोडर के लिए, एक एन्क्रिप्टेड बैकअप के लिए

यह पूरा सिस्टम निष्क्रिय स्थिति (idle) में 4 से 6 वॉट और लोड के दौरान 9 से 12 वॉट बिजली की खपत करता है। 20,000 mAh का बैटरी बैंक इसे पूरे दिन चलाता रहता है। मुख्य बात यही है: एक ऐसा मस्तिष्क जिसे आप साथ न ले जा सकें, वह ऐसा मस्तिष्क है जिसका आप उपयोग नहीं करेंगे।

सॉफ्टवेयर स्टैक (जानबूझकर न्यूनतम रखा गया)

अत्यधिक फैलाव (Bloat) ऑडिट क्षमता को खत्म कर देता है। पूरा सिस्टम Docker Compose के साथ ऑर्केस्ट्रेट किए गए चार कंटेनर चलाता है:

  1. Qdrant — Rust में लिखा गया एक वेक्टर डेटाबेस। यह हल्का है, ARM पर चलता है, और शुद्ध गति की तुलना में मेटाडेटा फ़िल्टरिंग को बेहतर ढंग से संभालता है।

  2. Ollama — एक क्वांटाइज्ड भाषा मॉडल की सेवा (serving) करता है। 8GB वाले Pi 5 के लिए सबसे उपयुक्त मॉडल llama3.1:8b-instruct-q4_K_M है। यह समाहित होने के लिए पर्याप्त छोटा है और वास्तविक गद्य लिखने के लिए पर्याप्त शक्तिशाली है।

  3. Nomic Embed Text v1.5 — एम्बेडिंग मॉडल जो आपके टेक्स्ट को वेक्टर में बदलता है। यह कॉम्पैक्ट है, रिकॉल में अच्छा है, और ARM प्रोसेसर पर ठीक से चलता है।

  4. एक FastAPI सर्वर (Python की ~180 पंक्तियाँ) जो सब कुछ एक साथ जोड़ता है: दस्तावेज़ों को इनगेस्ट (ingest) करना, मिलान प्राप्त करना, प्रॉम्प्ट बनाना, मॉडल को कॉल करना, उत्तर वापस देना।

कोई LangChain नहीं। कोई जादुई चेन नहीं जो यह छिपाए कि प्रॉम्प्ट कैसे बनाया जाता है। आप पूर्वाग्रह (bias) देख सकते हैं क्योंकि आप टेम्पलेट देखते हैं।

ज्ञान को ठीक से कैसे इनगेस्ट (Ingest) करें

चंकिंग (Chunking) मायने रखती है। सिस्टम Markdown फ़ाइलों को 700 से 900 टोकन पर चंक करता है, जिसमें चंक्स के बीच 100 से 150 टोकन का ओवरलैप होता है। वह ओवरलैप सीमाओं के पार संदर्भ (context) को बनाए रखता है — किनारे के शब्द पहले आई बातों से अलग नहीं होते।

कोड के लिए, यह tree-sitter (सिंटैक्स संरचना के प्रति जागरूक एक पार्सर) का उपयोग करके फ़ंक्शन या क्लास के आधार पर चंक करता है, और भाषा तथा सिंबल नाम को मेटाडेटा के रूप में स्टोर करता है।

PDF के लिए, यह स्थानीय रूप से OCR चलाता है, हेडिंग के आधार पर चंक करता है, और पेज नंबर रखता है ताकि आप मूल दस्तावेज़ ढूंढ सकें।

यह स्रोत फ़ाइलों के SHA256 हैश की गणना करता है। जब आप फिर से इनगेस्ट करते हैं, तो अपरिवर्तित फ़ाइलें प्रोसेसिंग से छूट जाती हैं — समझदार और तेज़।

रिट्रीवल: वास्तविक उत्तर प्राप्त करना

जब आप कोई प्रश्न पूछते हैं:

  1. सिस्टम आपके प्रश्न (query) को वेक्टर के रूप में एम्बेड करता है।
  2. यह शीर्ष 12 सबसे समान चंक्स के लिए Qdrant खोजता है।
  3. यह एक विविधता रीरैंक (maximal marginal relevance) लागू करता है ताकि आपको विभिन्न दृष्टिकोण मिलें, न कि केवल एक ही विचार के 12 संस्करण।
  4. यदि आपका प्रश्न संकेत देता है तो यह टैग या तिथियों द्वारा फ़िल्टर करता है।

तेज़ गलत उत्तर धीमे सही उत्तरों से बदतर होते हैं। सिस्टम गति की तुलना में शुद्धता (correctness) को प्राथमिकता देता है।

सुरक्षा और गोपनीयता

Argon2id (PBKDF2 नहीं) का उपयोग करके LUKS2 के साथ NVMe को एन्क्रिप्ट करें। की-फ़ाइल को एक USB ड्राइव पर स्टोर करें जिसे आप बूट के बाद भौतिक रूप से हटा देते हैं, या एक मज़बूत पासफ़्रेज़ याद रखें। डेटा पार्टीशन को noexec और nodev फ़्लैग के साथ माउंट करें ताकि कोड इससे रन न हो सके।

ऑपरेटिंग सिस्टम को रीड-ओनली ओवरले पर रखें ताकि अचानक बिजली जाने (power loss) पर आपकी रूट फ़ाइलसिस्टम दूषित न हो।

यह कोई वहम (paranoia) नहीं है। आप एक संज्ञानात्मक उपकरण (cognitive appliance) का निर्माण कर रहे हैं, न कि कोई हॉबी प्रोजेक्ट। डेटा ही आपकी सोच है।

निष्कर्ष

विस्तारित मन (extended mind) वास्तविक है। आपके उपकरण आपकी सोच को आकार देते हैं। दशकों से, हमने सुविधा के बदले स्वामित्व का सौदा किया है, अपनी वर्किंग मेमोरी को ऐसे प्लेटफार्मों के साथ स्टोर किया है जो निगरानी और निष्कर्षण के लिए अनुकूलित हैं। आप इसे वापस ले सकते हैं — धैर्य और कुछ हार्डवेयर सेटअप के साथ, आपका दूसरा मस्तिष्क केवल आपका, ऑफ़लाइन, तेज़ और वास्तव में निजी हो सकता है।

गुण

  • पूरी तरह से निजी: कोई क्लाउड नहीं, कोई तीसरे पक्ष की पहुँच नहीं, सम्मन (subpoena) करने के लिए कुछ भी नहीं।
  • आप पूरे स्टैक को नियंत्रित करते हैं: कोड की हर पंक्ति देखें, हर फैसले को समझें।
  • पोर्टेबल और कम बिजली की खपत करने वाला: बैटरी पर पूरे दिन चलता है।
  • सटीक: RAG साइटेशन (उद्धरण) आपको स्रोतों को सत्यापित करने और भ्रमित करने वाली जानकारी (hallucination) से बचने की अनुमति देते हैं।
  • अपडेट करने योग्य: बिना पुनर्रशिक्षण के नया ज्ञान जोड़ें।
  • पूरी तरह से ऑफ़लाइन काम करता है: कोई API दर सीमा (rate limits) नहीं, क्लाउड के लिए प्रतीक्षा करने वाली कोई विलंबता (latency) नहीं।

दोष

  • तकनीकी सेटअप की आवश्यकता है: पॉइंट-एंड-क्लिक नहीं है।
  • इन्फरेंस (Inference) डिवाइस हार्डवेयर पर होता है: तत्काल (instant) नहीं।
  • बहुत बड़े क्लाउड मॉडलों की तुलना में सीमित मॉडल गुणवत्ता।
  • रखरखाव आपके अधिकार में है: अपडेट, सुरक्षा पैच, हार्डवेयर की विफलताएं आपकी ज़िम्मेदारी हैं।
  • छोटा ज्ञान आधार (knowledge base): Pi की स्टोरेज द्वारा सीमित (हालाँकि व्यक्तिगत उपयोग के लिए 1TB पर्याप्त है)।

सावधानी

यह लेख शैक्षिक है और सार्वजनिक रूप से उपलब्ध जानकारी का सारांश प्रस्तुत करता है। यदि आप इस सिस्टम का निर्माण करते हैं, तो किसी भी उदाहरण मान को अपने स्वयं के कॉन्फ़िगरेशन से बदलें। मूल स्रोत के विरुद्ध सभी तकनीकी दावों को सत्यापित करें और महत्वपूर्ण कार्यों के लिए अपने सिस्टम पर निर्भर रहने से पहले पूरी तरह से परीक्षण करें। यदि आपका थ्रेट मॉडल (threat model) गंभीर है, तो सुरक्षा (विशेष रूप से एन्क्रिप्शन) को क्रिप्टोग्राफी विशेषज्ञता वाले किसी व्यक्ति द्वारा मान्य किया जाना चाहिए। यह लेख सुरक्षा सलाह का गठन नहीं करता है।

अक्सर पूछे जाने वाले प्रश्न

  • व्यक्तिगत ज्ञान प्रणालियों के लिए RAG और fine-tuning में क्या अंतर है?
  • क्या एक Raspberry Pi 5 वास्तव में एक पूर्ण AI रिट्रीवल सिस्टम को ऑफ़लाइन चला सकता है?
  • आप 1TB Pi ड्राइव पर कितना ज्ञान स्टोर कर सकते हैं?
  • पूरी तरह से लोकल सेटअप के बावजूद भी कौन से गोपनीयता जोखिम बने रहते हैं?
  • क्या आप अपने व्यक्तिगत मस्तिष्क को कई उपकरणों के बीच सुरक्षित रूप से सिंक कर सकते हैं?
  • इसे सेटअप करने के लिए आपको किन प्रोग्रामिंग कौशलों की आवश्यकता है?
  • क्या यह दृष्टिकोण क्लाउड नोट-टेकिंग ऐप्स का उपयोग करने से बेहतर है?
  • बैटरी बैकअप वाला Raspberry Pi system कितना पोर्टेबल है?

टैग

#privacy #raspberrypi #rag #ai #offline #security #locallm #personalknowledge

Free field guide

Incident Response: First Hour

A calm, evidence-preserving checklist for establishing control, bounding impact, communicating clearly, and containing an incident safely.