Ollama के साथ AI मॉडल स्थानीय रूप से चलाएँ
फ़्रंटियर मॉडल क्लाउड में रहते हैं, लेकिन ओपन-वेट मॉडलों का एक पूरा वर्ग — Llama, Mistral, Qwen, DeepSeek, Gemma — जिन्हें आप डाउनलोड करके अपने लैपटॉप या सर्वर पर चला सकते हैं। Ollama ऐसा करने का सबसे सरल तरीका है: एक इंस्टॉल, एक कमांड, और एक मॉडल स्थानीय रूप से चल रहा है। यह पेज आपको शून्य से एक चलते हुए मॉडल तक, इसे कोड से कॉल करने तक, और समझौतों को जानने तक ले जाता है ताकि आप 7B स्थानीय मॉडल से फ़्रंटियर मॉडल जैसा व्यवहार करने की उम्मीद न करें।
- जानें कि आप एक मॉडल स्थानीय रूप से क्यों चलाएँगे — और क्लाउड फ़्रंटियर मॉडलों की तुलना में ईमानदार समझौते
- Ollama इंस्टॉल करें और दो कमांड में अपना पहला मॉडल चलाएँ
- मूल CLI का उपयोग करें: pull, run, list, ps, rm, stop
- Ollama के OpenAI-संगत API के माध्यम से अपने स्थानीय मॉडल को कोड से कॉल करें
- RAM की ज़रूरतें, मॉडल आकार और क्वांटाइज़ेशन को समझें — ताकि आप ऐसा मॉडल चुनें जिसे आपकी मशीन वास्तव में चला सके
- जानें कि कब LM Studio (एक GUI) शुरुआत के लिए बेहतर विकल्प है
एक मॉडल स्थानीय रूप से क्यों चलाएँ (और कब नहीं)
अपने हार्डवेयर पर मॉडल चलाना आपको चार चीज़ें देता है:
- निजता — आपके प्रॉम्प्ट और डेटा कभी आपकी मशीन से बाहर नहीं जाते। यही कारण है कि विनियमित या संवेदनशील क्षेत्रों की टीमें स्थानीय मॉडलों की ओर बढ़ती हैं। (Choosing a Model में निजता/सेल्फ-होस्ट कांटा देखें।)
- ऑफ़लाइन — कोई इंटरनेट नहीं, कोई API नहीं, कोई आउटेज निर्भरता नहीं। मॉडल आपकी डिस्क पर एक फ़ाइल है।
- लागत — कोई प्रति-टोकन बिल नहीं। एक बार डाउनलोड हो जाने पर, इसे चलाना "मुफ़्त" है (आप बिजली और हार्डवेयर में भुगतान करते हैं, API खर्च में नहीं)। यदि पैमाने पर टोकन खर्च आपकी बाधा है, तो स्थानीय जीत सकता है।
- नियंत्रण — एक सटीक संस्करण पिन करें, व्यवहार को अनुकूलित करें, और रेट लिमिट या सेवा-की-शर्तों की चौंकाने वाली बातों के बिना एकीकृत करें।
ईमानदार समझौते:
- क्षमता का अंतर। एक मॉडल जिसे आप लैपटॉप पर चला सकते हैं (1B–14B पैरामीटर) कठिन तर्क, लंबे-संदर्भ, या एजेंटिक कार्यों पर एक फ़्रंटियर क्लाउड मॉडल की तुलना में नहीं है। कई रोज़मर्रा के कार्यों के लिए अंतर छोटा है; सबसे कठिन कार्यों के लिए यह बड़ा है।
- हार्डवेयर। बड़े, अधिक सक्षम मॉडलों को एक सामान्य मशीन की तुलना में अधिक RAM/VRAM की आवश्यकता होती है। आप अक्सर सबसे बड़ा मॉडल जो आपका हार्डवेयर चला सके चुन रहे होते हैं, न कि सबसे अच्छा मॉडल जो मौजूद है।
- आप इसे संचालित करते हैं। कोई प्रबंधित स्केलिंग नहीं, कोई स्वचालित अपग्रेड नहीं — यही नियंत्रण की कीमत है।
एक सामान्य, टिकाऊ पैटर्न: एक छोटे eval के साथ प्रोटोटाइप बनाएँ और चुनें (क्लाउड मॉडलों जैसी ही विधि — देखें Choosing a Model), निजी/ऑफ़लाइन/पैमाने-पर-सस्ते काम के लिए स्थानीय का उपयोग करें, और जब कार्य को वास्तव में अतिरिक्त क्षमता की आवश्यकता हो तब एक फ़्रंटियर API की ओर बढ़ें।
Ollama इंस्टॉल करें और अपना पहला मॉडल चलाएँ
- macOS और Windows: ollama.com/download से इंस्टॉलर डाउनलोड करें और इसे चलाएँ। Linux: आधिकारिक इंस्टॉल स्क्रिप्ट का उपयोग करें (नीचे)। यह ollama कमांड और एक स्थानीय बैकग्राउंड सेवा इंस्टॉल करता है।
- ollama run <model> पहली बार उपयोग पर मॉडल डाउनलोड करता है (यह कई GB का हो सकता है), फिर आपको एक इंटरैक्टिव चैट में ले जाता है। पहला रन धीमा होता है क्योंकि यह वेट खींच रहा है; बाद के रन तुरंत होते हैं।
- एक प्रॉम्प्ट टाइप करें और Enter दबाएँ। इंटरैक्टिव सत्र छोड़ने के लिए, /bye टाइप करें (या Ctrl+D दबाएँ)। मॉडल अगली बार के लिए डिस्क पर कैश रहता है।
- इंस्टॉल किए गए मॉडल देखने के लिए ollama list और डिस्क स्थान वापस पाने के लिए किसी एक को हटाने हेतु ollama rm <model> का उपयोग करें।
Linux इंस्टॉल (macOS/Windows इसके बजाय डाउनलोड किए गए इंस्टॉलर का उपयोग करें):
curl -fsSL https://ollama.com/install.sh | sh
एक छोटा मॉडल खींचें और चलाएँ (अच्छा पहला विकल्प)
ollama run llama3.2
वह एकल कमांड llama3.2 (एक छोटा 1B/3B-श्रेणी का मॉडल जो साधारण हार्डवेयर पर चलता है) दोनों डाउनलोड करता है और एक इंटरैक्टिव चैट शुरू करता है। अभी चैट किए बिना डाउनलोड करने के लिए, इसके बजाय ollama pull का उपयोग करें।
मूल CLI
मुट्ठी भर कमांड लगभग सब कुछ कवर करते हैं। पूरी सूची के लिए ollama --help चलाएँ।
# चैट शुरू किए बिना एक मॉडल डाउनलोड करें
ollama pull qwen3
# एक इंटरैक्टिव चैट शुरू करें (आवश्यक होने पर पहले डाउनलोड करता है)
ollama run qwen3
# वन-शॉट: प्रॉम्प्ट को इनलाइन पास करें, उत्तर पाएँ, बाहर निकलें
ollama run qwen3 "Summarize the CAP theorem in two sentences."
# आपने जो मॉडल डाउनलोड किए हैं उन्हें सूचीबद्ध करें
ollama list
# वर्तमान में मेमोरी में लोड किए गए मॉडल दिखाएँ
ollama ps
# एक चल रहे/लोड किए गए मॉडल को रोकें (मेमोरी मुक्त करता है)
ollama stop qwen3
# डिस्क वापस पाने के लिए एक डाउनलोड किए गए मॉडल को हटाएँ
ollama rm qwen3
एक इंटरैक्टिव ollama run सत्र के अंदर, बाहर निकलने के लिए /bye टाइप करें और इन-सत्र कमांड देखने के लिए /? टाइप करें। बैकग्राउंड सेवा जो वास्तव में मॉडलों की सेवा करती है वह ollama serve द्वारा शुरू होती है (डेस्कटॉप ऐप इसे आपके लिए स्वचालित रूप से शुरू करता है)।
इसे कोड से कॉल करें (OpenAI-संगत API)
यही वह हिस्सा है जो स्थानीय मॉडलों को ऐप्स में वास्तव में उपयोगी बनाता है। Ollama बैकग्राउंड सेवा http://localhost:11434 पर, डिफ़ॉल्ट पोर्ट 11434 पर एक स्थानीय HTTP API उजागर करती है। इसके अपने नेटिव एंडपॉइंट हैं (/api/generate, /api/chat) और /v1 पर एक OpenAI-संगत परत है — इसलिए OpenAI SDK के लिए लिखा गया अधिकांश कोड दो लाइनें बदलकर आपके स्थानीय मॉडल के विरुद्ध काम करता है।
curl के साथ रॉ HTTP (नेटिव एंडपॉइंट):
curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [
{ "role": "user", "content": "Why is the sky blue?" }
],
"stream": false
}'
आधिकारिक OpenAI SDK का उपयोग करके Python से — बस base_url को Ollama पर इंगित करें और कोई भी गैर-रिक्त api_key पास करें (Ollama को फ़ील्ड आवश्यक है लेकिन इसका मान अनदेखा करता है):
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # required by the SDK, ignored by Ollama
)
response = client.chat.completions.create(
model="llama3.2",
messages=[
{"role": "system", "content": "You are a concise assistant."},
{"role": "user", "content": "Explain gradient descent in two sentences."},
],
)
print(response.choices[0].message.content)
क्योंकि यह OpenAI-संगत है, वही पैटर्न जो आप एक होस्टेड API के विरुद्ध उपयोग करेंगे, यहाँ भी लागू होते हैं — जिसमें स्ट्रीमिंग और tool use / function calling शामिल हैं, जो स्थानीय रूप से वैसे ही काम करते हैं जैसे वे क्लाउड में करते हैं (बशर्ते मॉडल वास्तव में इसमें अच्छा हो)। Ollama की /v1 परत /v1/chat/completions, /v1/completions, /v1/models और /v1/embeddings को, अन्य के अलावा, कवर करती है।
हार्डवेयर, मॉडल आकार और क्वांटाइज़ेशन
एक मॉडल से जुड़ी संख्या जो आप देखेंगे — 1B, 7B, 8B, 70B — इसकी पैरामीटर गणना (अरबों में) है। अधिक पैरामीटर आम तौर पर अधिक सक्षम और अधिक मेमोरी-भूखा होने का अर्थ है। आप क्या चला सकते हैं इस पर व्यावहारिक सीमा RAM है (और GPU पर, VRAM)।
क्वांटाइज़ेशन वह प्रमुख तरकीब है जो इसे सामान्य मशीनों पर संभव बनाती है। मॉडल के वेट मूल रूप से उच्च परिशुद्धता में संग्रहीत होते हैं (जैसे 16-बिट), लेकिन उन्हें एक छोटी, अक्सर बमुश्किल-ध्यान देने योग्य गुणवत्ता लागत के साथ ~4-बिट तक संपीड़ित किया जा सकता है। Ollama अधिकांश मॉडलों को डिफ़ॉल्ट रूप से क्वांटाइज़ किया हुआ भेजता है — यही कारण है कि अरबों पैरामीटर वाला मॉडल कुछ GB में फिट हो सकता है। एक मोटा अंगूठे का नियम (विशिष्ट मॉडल के पेज के विरुद्ध सत्यापित करें):
- ~1B–3B मॉडल: अधिकांश आधुनिक लैपटॉप पर आराम से चलते हैं (कुछ GB RAM)।
- ~7B–8B मॉडल: सक्षम-फिर-भी-चलाने-योग्य के लिए स्वीट स्पॉट; कई GB खाली RAM का बजट रखें।
- ~13B–14B मॉडल: एक ठीक-ठाक स्पेक वाली मशीन की आवश्यकता है।
- ~70B+ मॉडल: बहुत सारी RAM या एक मज़बूत GPU वाले वर्कस्टेशन/सर्वर की आवश्यकता है — सामान्य लैपटॉप का क्षेत्र नहीं।
एक व्यावहारिक नुस्खा: एक छोटे मॉडल (llama3.2) से शुरू करें, वर्कफ़्लो को अंत-से-अंत तक पुष्ट करें, फिर सबसे बड़े मॉडल तक आकार बढ़ाएँ जो अभी भी आपके हार्डवेयर पर सुचारू रूप से चले — न कि सबसे बड़े तक जो मौजूद है।
LM Studio: एक GUI विकल्प
यदि कमांड लाइन आपकी पसंद नहीं है, तो LM Studio एक डेस्कटॉप ऐप (macOS, Windows, Linux) है जो एक ग्राफ़िकल इंटरफ़ेस के माध्यम से वही काम करता है: ओपन मॉडल ब्राउज़ और डाउनलोड करें, उनसे एक अंतर्निर्मित UI में चैट करें, और — Ollama की तरह — एक स्थानीय OpenAI-संगत सर्वर चलाएँ ताकि आपका कोड इससे बात कर सके। यह गैर-डेवलपर्स के लिए या टर्मिनल पर पॉइंट-एंड-क्लिक पसंद करने वाले किसी भी व्यक्ति के लिए आसान ऑन-रैंप है; जब आप एक स्क्रिप्ट-योग्य CLI और एक हल्की बैकग्राउंड सेवा चाहते हैं तब Ollama जीतता है। दोनों एक ही तरह के ओपन-वेट मॉडल चलाते हैं, इसलिए इस पेज की अवधारणाएँ सीधे स्थानांतरित होती हैं।
खुद जाँचें
0/4- स्थानीय = निजता + ऑफ़लाइन + कोई प्रति-टोकन लागत नहीं + नियंत्रण; समझौता एक वास्तविक क्षमता का अंतर और हार्डवेयर सीमाएँ हैं।
- दो कमांड आपको चालू कर देते हैं: Ollama इंस्टॉल करें, फिर ollama run llama3.2।
- मूल CLI: pull (डाउनलोड), run (चैट), list, ps, stop, rm — बस इतना ही अधिकांश है।
- इसे कोड से OpenAI-संगत एंडपॉइंट के माध्यम से कॉल करें: base_url http://localhost:11434/v1, कोई भी गैर-रिक्त api_key।
- पैरामीटर गणना + क्वांटाइज़ेशन तय करते हैं कि आपकी मशीन एक मॉडल चला सकती है या नहीं — छोटे से शुरू करें, जो सुचारू रूप से चले उस तक आकार बढ़ाएँ।
- GUI पसंद है? LM Studio वही काम पॉइंट-एंड-क्लिक से करता है और एक स्थानीय OpenAI-संगत सर्वर भी उजागर करता है।
स्रोत और आगे पढ़ें
- Ollama — आधिकारिक साइट और डाउनलोड।
- Ollama मॉडल लाइब्रेरी — वर्तमान मॉडल और उनके सटीक pull नाम/आकार।
- Ollama CLI संदर्भ · Ollama API दस्तावेज़ — आधिकारिक कमांड और एंडपॉइंट संदर्भ।
- Ollama OpenAI-संगतता ब्लॉग पोस्ट —
/v1एंडपॉइंट और SDK उपयोग। - GitHub पर Ollama — स्रोत, इश्यू, और विस्तृत दस्तावेज़।
- LM Studio — स्थानीय मॉडल चलाने के लिए GUI विकल्प।
आगे
- किसी कार्य के लिए स्थानीय बनाम क्लाउड तय करें → Choosing a Model
- टूल्स को स्थानीय रूप से भी काम करवाएँ → Tool Use
- देखें कि मॉडल चलाने में वास्तव में कितना खर्च आता है → Token Economy