अपना खदु का Agentic AI चलाएं: Ollama इंस्टॉलेशन, 64K कॉन्टेक्स्ट वेरि एंट ट्यनिूनिगं और Hermes वर्कफ़्लो की सपं र्णू र्णगाइड
जब भी आप ChatGPT, Claude या अन्य ऑनलाइन AI सेवाओंका उपयोग करतेहैं, तो आप इसके बदलेमें या तो अपनी सवं ेदनशील जानकारी (Data) साझा करतेहैं, या फि र हर महीनेभारी सब्सक्रि प्शन फीस और API बि ल चकु ातेहैं। लेकि न क्या आप जानतेहैंकि आप अपनेही कंप्यटू र पर एक सपं र्णू ,र्ण शक्ति शाली और 100% प्राइवेट AI असि स्टेंट चला सकतेहैं? एक ऐसा AI मॉडल जो आपके पर्सनर्स ल नोट्स (जसै ेObsidian Vaults) और सवं ेदनशील फाइलों का वि श्लेषण करेऔर जि सका एक भी अक्षर आपके कंप्यटू र से बाहर न जाए।
इस वि स्ततृ गाइड मेंहम जानेंगेकि Ollama का उपयोग करके मात्र 1 मि नट मेंलोकल LLM कैसेसेटअप करें, Gemma 4 (E4B) जसै ेअत्याधनिुनिक ओपन-वेट मॉडल्स का उपयोग कैसेकरें, और Hermes Agent Harness के लि ए 64K कॉन्टेक्स्ट वि डं ो वेरि एंट्स कैसे तयै ार करें।
1. लोकल AI मॉडल क्यों चलाना चाहि ए? (3 मख्ु य कारण)
लोकल मॉडल केवल डवे लपर्स के लि ए नहीं, बल्कि हर उस व्यक्ति के लि ए आवश्यक हैजो डटे ा सरुक्षा और नि रंतरता को प्राथमि कता देता है:
- 1. पर्णू र्णगोपनीयता (Absolute Privacy): क्लाउड AI पर पछू ेगए सवाल और अपलोड कि ए गए डाक्यमू ेंट्स थर्ड-र्डपार्टी सर्वर्सर्व र्सपर प्रोसेस होतेहैं। लोकल मॉडल मेंसारा कंप्यटूेशन सीधेआपकी मशीन (GPU/CPU) पर होता है।
- 2. शन्ूय लागत (Zero Running Cost): एक बार मॉडल डाउनलोड हो जानेके बाद आप असीमि त क्वेरीज कर सकतेहैं। टोकन लि मि ट्स या क्रेडि ट्स खत्म होनेकी कोई चि तं ा नहीं होती।
- 3. ऑफलाइन उपलब्धता (Offline Independence): बि ना एक्टि व इंटरनेट कनेक्शन के भी आप अपनेनोट्स, कोडि गं और रि सर्च का काम जारी रख सकतेहैं।
🧠 Obsidian & 'Second Brain' इंटीग्रेशन: जब आप अपनेपर्सनर्स ल नॉलेज बेस (Obsidian Vault) को लोकल LLM सेजोड़तेहैं, तो आप अपनी हजारों फाइलों मेंबि ना कि सी क्लाउड लीकेज के सि मेंटि क सर्च और पर्सनर्स ल वि की (LLM Wiki) तयै ार कर सकतेहैं।
| हार्डवर्ड ेयर स्पेक्स (Hardware Specs) | अनशं ु सि त मॉडल (Recommended Model) | इफेक्टि व साइज एवंमेमोरी खपत | सर्वश्रर्व ेष्ठ उपयोग (Best Use Case) |
|---|---|---|---|
| 4 GB RAM / स्मार्टफोन | Gemma 4 E2B | ~1.5 GB VRAM / डि स्क | बेसि क टेक्स्ट चटै और मोबाइल डि प्लॉयमेंट |
| 8 GB - 16 GB RAM (सामान्य लपै टॉप) | Gemma 4 E4B (Recommended) | ~3.3 GB (12B जसै ा परफॉर्मेंसर्में ) | डले ी नोट्स, कोडि गं और एजेंटि क टास्क्स |
| 32 GB+ RAM / डडिेडिकेटेड GPU | Gemma 4 12B / 31B या Qwen 3.6 | 8 GB - 20 GB VRAM | एडवांस रीजनि गं , लॉन्ग-कंटेक्स्ट और फुल एजेंट हार्नेस |
2. Ollama इंस्टॉलेशन एवंपहला लोकल मॉडल रन करना
Ollama वि डं ोज, मकै और लि नक्स पर लोकल मॉडल्स चलानेका सबसेसरल और सगु म टूल है:
Ollama डाउनलोड एवं इंस्टॉल करें
आधि कारि क वेबसाइट (ollama.com) सेअपनेऑपरेटि गं सि स्टम के अनसु ार ऐप
डाउनलोड करेंया टर्मि नर्मि ल मेंकमांड रन करें। इंस्टॉलेशन की पष्टिुष्टि के लि ए टर्मि नर्मि ल मेंवर्जनर्ज चेक करें:
ollama --version Gemma 4 (E4B) मॉडल डाउनलोड करें
Google DeepMind का Gemma 4 E4B मॉडल डाउनलोड करें। यह Effective Parameter तकनीक का उपयोग करता हैजि ससेकम मेमोरी में12B मॉडल जसै ी बद्ुधि मत्ता मि लती है:
ollama pull gemma4:e4b
ollama list
लोकल चटै प्रारंभ करें
टर्मि नर्मि ल मेंरन कमांड देतेही मॉडल एक्टि वेट हो जाएगा और आप 100% प्राइवेसी के साथ सीधेचटै कर सकतेहैं:
ollama run gemma4:e4b
3. 64K कॉन्टेक्स्ट वेरि एंट ट्यनिूनिगं (Agentic AI के लि ए क्यों आवश्यक है?)
डि फ़ॉल्ट रूप सेअधि कांश लोकल मॉडल्स 32,768 (32K) या कम टोकन कॉन्टेक्स्ट वि डं ो पर चलतेहैं। लेकि न जब आप Hermes जसै ेऑटोनॉमस AI एजेंट्स का उपयोग करतेहैं, तो टूल्स (Tool Calling), मेमोरी और सि स्टम प्रॉम्प्ट्स को सभं ालनेके लि ए न्यनू तम 64,000 (64K) टोकन्स की आवश्यकता होती है।
💡 बि ना हार्ड डि स्क स्पेस गवं ाए वेरि एंट बनाना: Ollama का
Modelfile आर्कि टेक्चर बेस मॉडल को डुप्लीकेट नहींकरता, बल्कि उसी लेयर पर एक
कस्टमाइज्ड कॉन्फ़ि गरेशन लेयर जोड़ देता है।
# टर्मि नर्मि ल में64K कॉन्टेक्स्ट वेरि एंट तयै ार करनेका वन-लाइनर:
echo "FROM gemma4:e4b\nPARAMETER num_ctx 64000" | ollama create gemma4-64k -f -
# जांचेंकि नया वेरि एंट सक्रि य है:
ollama run gemma4-64k
ollama ps
4. Hermes Agent Harness के साथ लोकल एंडपॉइंट इंटीग्रेशन
लोकल मॉडल को कि सी भी एजेंटि क सि स्टम (Hermes, OpenClaw, Codex या Claude Code) सेजोड़ने के लि ए Ollama एक OpenAI-कम्पटिैटिबल एंडपॉइंट प्रदान करता है:
कस्टम एंडपॉइंट कॉन्फ़ि गरेशन
Hermes एजेंट की सेटि ग्ं स मेंजाकर Custom Endpoint चनु ेंऔर लोकल एड्रसे दर्ज करें:
# Ollama Local OpenAI-Compatible API Endpoint:
http://localhost:11434/v1
कनेक्ट होतेही Hermes आपकी मशीन पर चल रहेgemma4-64k मॉडल को डि टेक्ट
कर लेगा और 24/7 बि ना कि सी API खर्च के टास्क एग्जीक्यटू करना शरूु कर देगा।
5. सपं र्णू र्णकोड एवंस्क्रि प्ट्स डाउनलोड करें(Download Code File)
आप इस सपं र्णू र्णब्लॉग पोस्ट के सोर्स कोड या ऑटो-सेटअप बशै स्क्रि प्ट को 1-क्लि क मेंअपनेकंप्यटू र पर डाउनलोड कर सकतेहैं:
📥 Download Ready-to-Use Files
लोकल AI सेटअप कोड, Modelfile कॉन्फ़ि ग और सपं र्णू र्णHTML ब्लॉग टेम्पलेट
#!/bin/bash
# Ollama & Hermes 64K Fast Automated Setup Script
echo "[*] Checking Ollama Installation..."
if ! command -v ollama &> /dev/null; then
echo "[-] Ollama not found. Please install it from https://ollama.com"
exit 1
fi
echo "[+] Pulling Gemma 4 (E4B) Model..."
ollama pull gemma4:e4b
echo "[+] Creating 64K Context Variant for Hermes..."
echo -e "FROM gemma4:e4b\nPARAMETER num_ctx 64000" | ollama create gemma4-64k -f -
echo "[✓] Setup Complete! Set your Hermes API Endpoint to: http://localhost:11434/v1" echo "[✓] Selected Model: gemma4-64k"
6. नि ष्कर्ष:र्ष आपका नि जी AI इकोसि स्टम
लोकल AI मॉडल्स और Agentic वर्कफ़्लो का यह सयं ोजन तकनीक की दनिुनिया मेंवास्तवि क स्वतत्रं ता (Digital Sovereignty) लाता है। अपनेसवं ेदनशील प्रोजेक्ट्स, व्यक्ति गत ज्ञान (Second Brain) और कोडि गं कार्यों को बि ना कि सी डटे ा लीकेज के ऑटोमेट करें। आज ही Ollama और Hermes के साथ अपना स्वयंका नि जी AI असि स्टेंट स्थापि त करें।
No comments:
Post a Comment