मुख्य कंटेंट तक स्किप करें

Ollama के साथ AI मॉडल स्थानीय रूप से चलाएँ

मध्यम

फ़्रंटियर मॉडल क्लाउड में रहते हैं, लेकिन ओपन-वेट मॉडलों का एक पूरा वर्ग — Llama, Mistral, Qwen, DeepSeek, Gemma — जिन्हें आप डाउनलोड करके अपने लैपटॉप या सर्वर पर चला सकते हैं। Ollama ऐसा करने का सबसे सरल तरीका है: एक इंस्टॉल, एक कमांड, और एक मॉडल स्थानीय रूप से चल रहा है। यह पेज आपको शून्य से एक चलते हुए मॉडल तक, इसे कोड से कॉल करने तक, और समझौतों को जानने तक ले जाता है ताकि आप 7B स्थानीय मॉडल से फ़्रंटियर मॉडल जैसा व्यवहार करने की उम्मीद न करें।

What you'll learn
  • जानें कि आप एक मॉडल स्थानीय रूप से क्यों चलाएँगे — और क्लाउड फ़्रंटियर मॉडलों की तुलना में ईमानदार समझौते
  • Ollama इंस्टॉल करें और दो कमांड में अपना पहला मॉडल चलाएँ
  • मूल CLI का उपयोग करें: pull, run, list, ps, rm, stop
  • Ollama के OpenAI-संगत API के माध्यम से अपने स्थानीय मॉडल को कोड से कॉल करें
  • RAM की ज़रूरतें, मॉडल आकार और क्वांटाइज़ेशन को समझें — ताकि आप ऐसा मॉडल चुनें जिसे आपकी मशीन वास्तव में चला सके
  • जानें कि कब LM Studio (एक GUI) शुरुआत के लिए बेहतर विकल्प है

एक मॉडल स्थानीय रूप से क्यों चलाएँ (और कब नहीं)

अपने हार्डवेयर पर मॉडल चलाना आपको चार चीज़ें देता है:

  • निजता — आपके प्रॉम्प्ट और डेटा कभी आपकी मशीन से बाहर नहीं जाते। यही कारण है कि विनियमित या संवेदनशील क्षेत्रों की टीमें स्थानीय मॉडलों की ओर बढ़ती हैं। (Choosing a Model में निजता/सेल्फ-होस्ट कांटा देखें।)
  • ऑफ़लाइन — कोई इंटरनेट नहीं, कोई API नहीं, कोई आउटेज निर्भरता नहीं। मॉडल आपकी डिस्क पर एक फ़ाइल है।
  • लागत — कोई प्रति-टोकन बिल नहीं। एक बार डाउनलोड हो जाने पर, इसे चलाना "मुफ़्त" है (आप बिजली और हार्डवेयर में भुगतान करते हैं, API खर्च में नहीं)। यदि पैमाने पर टोकन खर्च आपकी बाधा है, तो स्थानीय जीत सकता है।
  • नियंत्रण — एक सटीक संस्करण पिन करें, व्यवहार को अनुकूलित करें, और रेट लिमिट या सेवा-की-शर्तों की चौंकाने वाली बातों के बिना एकीकृत करें।

ईमानदार समझौते:

  • क्षमता का अंतर। एक मॉडल जिसे आप लैपटॉप पर चला सकते हैं (1B–14B पैरामीटर) कठिन तर्क, लंबे-संदर्भ, या एजेंटिक कार्यों पर एक फ़्रंटियर क्लाउड मॉडल की तुलना में नहीं है। कई रोज़मर्रा के कार्यों के लिए अंतर छोटा है; सबसे कठिन कार्यों के लिए यह बड़ा है।
  • हार्डवेयर। बड़े, अधिक सक्षम मॉडलों को एक सामान्य मशीन की तुलना में अधिक RAM/VRAM की आवश्यकता होती है। आप अक्सर सबसे बड़ा मॉडल जो आपका हार्डवेयर चला सके चुन रहे होते हैं, न कि सबसे अच्छा मॉडल जो मौजूद है।
  • आप इसे संचालित करते हैं। कोई प्रबंधित स्केलिंग नहीं, कोई स्वचालित अपग्रेड नहीं — यही नियंत्रण की कीमत है।

एक सामान्य, टिकाऊ पैटर्न: एक छोटे eval के साथ प्रोटोटाइप बनाएँ और चुनें (क्लाउड मॉडलों जैसी ही विधि — देखें Choosing a Model), निजी/ऑफ़लाइन/पैमाने-पर-सस्ते काम के लिए स्थानीय का उपयोग करें, और जब कार्य को वास्तव में अतिरिक्त क्षमता की आवश्यकता हो तब एक फ़्रंटियर API की ओर बढ़ें।

Ollama इंस्टॉल करें और अपना पहला मॉडल चलाएँ

Guided walkthrough1 of 4
  1. macOS और Windows: ollama.com/download से इंस्टॉलर डाउनलोड करें और इसे चलाएँ। Linux: आधिकारिक इंस्टॉल स्क्रिप्ट का उपयोग करें (नीचे)। यह ollama कमांड और एक स्थानीय बैकग्राउंड सेवा इंस्टॉल करता है।

Linux इंस्टॉल (macOS/Windows इसके बजाय डाउनलोड किए गए इंस्टॉलर का उपयोग करें):

curl -fsSL https://ollama.com/install.sh | sh

एक छोटा मॉडल खींचें और चलाएँ (अच्छा पहला विकल्प)

ollama run llama3.2

वह एकल कमांड llama3.2 (एक छोटा 1B/3B-श्रेणी का मॉडल जो साधारण हार्डवेयर पर चलता है) दोनों डाउनलोड करता है और एक इंटरैक्टिव चैट शुरू करता है। अभी चैट किए बिना डाउनलोड करने के लिए, इसके बजाय ollama pull का उपयोग करें।

मूल CLI

मुट्ठी भर कमांड लगभग सब कुछ कवर करते हैं। पूरी सूची के लिए ollama --help चलाएँ।

# चैट शुरू किए बिना एक मॉडल डाउनलोड करें
ollama pull qwen3

# एक इंटरैक्टिव चैट शुरू करें (आवश्यक होने पर पहले डाउनलोड करता है)
ollama run qwen3

# वन-शॉट: प्रॉम्प्ट को इनलाइन पास करें, उत्तर पाएँ, बाहर निकलें
ollama run qwen3 "Summarize the CAP theorem in two sentences."

# आपने जो मॉडल डाउनलोड किए हैं उन्हें सूचीबद्ध करें
ollama list

# वर्तमान में मेमोरी में लोड किए गए मॉडल दिखाएँ
ollama ps

# एक चल रहे/लोड किए गए मॉडल को रोकें (मेमोरी मुक्त करता है)
ollama stop qwen3

# डिस्क वापस पाने के लिए एक डाउनलोड किए गए मॉडल को हटाएँ
ollama rm qwen3

एक इंटरैक्टिव ollama run सत्र के अंदर, बाहर निकलने के लिए /bye टाइप करें और इन-सत्र कमांड देखने के लिए /? टाइप करें। बैकग्राउंड सेवा जो वास्तव में मॉडलों की सेवा करती है वह ollama serve द्वारा शुरू होती है (डेस्कटॉप ऐप इसे आपके लिए स्वचालित रूप से शुरू करता है)।

इसे कोड से कॉल करें (OpenAI-संगत API)

यही वह हिस्सा है जो स्थानीय मॉडलों को ऐप्स में वास्तव में उपयोगी बनाता है। Ollama बैकग्राउंड सेवा http://localhost:11434 पर, डिफ़ॉल्ट पोर्ट 11434 पर एक स्थानीय HTTP API उजागर करती है। इसके अपने नेटिव एंडपॉइंट हैं (/api/generate, /api/chat) और /v1 पर एक OpenAI-संगत परत है — इसलिए OpenAI SDK के लिए लिखा गया अधिकांश कोड दो लाइनें बदलकर आपके स्थानीय मॉडल के विरुद्ध काम करता है।

curl के साथ रॉ HTTP (नेटिव एंडपॉइंट):

curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [
{ "role": "user", "content": "Why is the sky blue?" }
],
"stream": false
}'

आधिकारिक OpenAI SDK का उपयोग करके Python से — बस base_url को Ollama पर इंगित करें और कोई भी गैर-रिक्त api_key पास करें (Ollama को फ़ील्ड आवश्यक है लेकिन इसका मान अनदेखा करता है):

from openai import OpenAI

client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # required by the SDK, ignored by Ollama
)

response = client.chat.completions.create(
model="llama3.2",
messages=[
{"role": "system", "content": "You are a concise assistant."},
{"role": "user", "content": "Explain gradient descent in two sentences."},
],
)

print(response.choices[0].message.content)

क्योंकि यह OpenAI-संगत है, वही पैटर्न जो आप एक होस्टेड API के विरुद्ध उपयोग करेंगे, यहाँ भी लागू होते हैं — जिसमें स्ट्रीमिंग और tool use / function calling शामिल हैं, जो स्थानीय रूप से वैसे ही काम करते हैं जैसे वे क्लाउड में करते हैं (बशर्ते मॉडल वास्तव में इसमें अच्छा हो)। Ollama की /v1 परत /v1/chat/completions, /v1/completions, /v1/models और /v1/embeddings को, अन्य के अलावा, कवर करती है।

हार्डवेयर, मॉडल आकार और क्वांटाइज़ेशन

एक मॉडल से जुड़ी संख्या जो आप देखेंगे — 1B, 7B, 8B, 70B — इसकी पैरामीटर गणना (अरबों में) है। अधिक पैरामीटर आम तौर पर अधिक सक्षम और अधिक मेमोरी-भूखा होने का अर्थ है। आप क्या चला सकते हैं इस पर व्यावहारिक सीमा RAM है (और GPU पर, VRAM)।

क्वांटाइज़ेशन वह प्रमुख तरकीब है जो इसे सामान्य मशीनों पर संभव बनाती है। मॉडल के वेट मूल रूप से उच्च परिशुद्धता में संग्रहीत होते हैं (जैसे 16-बिट), लेकिन उन्हें एक छोटी, अक्सर बमुश्किल-ध्यान देने योग्य गुणवत्ता लागत के साथ ~4-बिट तक संपीड़ित किया जा सकता है। Ollama अधिकांश मॉडलों को डिफ़ॉल्ट रूप से क्वांटाइज़ किया हुआ भेजता है — यही कारण है कि अरबों पैरामीटर वाला मॉडल कुछ GB में फिट हो सकता है। एक मोटा अंगूठे का नियम (विशिष्ट मॉडल के पेज के विरुद्ध सत्यापित करें):

  • ~1B–3B मॉडल: अधिकांश आधुनिक लैपटॉप पर आराम से चलते हैं (कुछ GB RAM)।
  • ~7B–8B मॉडल: सक्षम-फिर-भी-चलाने-योग्य के लिए स्वीट स्पॉट; कई GB खाली RAM का बजट रखें।
  • ~13B–14B मॉडल: एक ठीक-ठाक स्पेक वाली मशीन की आवश्यकता है।
  • ~70B+ मॉडल: बहुत सारी RAM या एक मज़बूत GPU वाले वर्कस्टेशन/सर्वर की आवश्यकता है — सामान्य लैपटॉप का क्षेत्र नहीं।

एक व्यावहारिक नुस्खा: एक छोटे मॉडल (llama3.2) से शुरू करें, वर्कफ़्लो को अंत-से-अंत तक पुष्ट करें, फिर सबसे बड़े मॉडल तक आकार बढ़ाएँ जो अभी भी आपके हार्डवेयर पर सुचारू रूप से चले — न कि सबसे बड़े तक जो मौजूद है।

स्थानीय-मॉडल शब्दावली
कार्ड पलटने के लिए Enter या Space दबाएँ। कार्ड बदलने के लिए बाएँ और दाएँ तीर कुंजियों का उपयोग करें।शब्द दिखाया गया।
1 / 6

LM Studio: एक GUI विकल्प

यदि कमांड लाइन आपकी पसंद नहीं है, तो LM Studio एक डेस्कटॉप ऐप (macOS, Windows, Linux) है जो एक ग्राफ़िकल इंटरफ़ेस के माध्यम से वही काम करता है: ओपन मॉडल ब्राउज़ और डाउनलोड करें, उनसे एक अंतर्निर्मित UI में चैट करें, और — Ollama की तरह — एक स्थानीय OpenAI-संगत सर्वर चलाएँ ताकि आपका कोड इससे बात कर सके। यह गैर-डेवलपर्स के लिए या टर्मिनल पर पॉइंट-एंड-क्लिक पसंद करने वाले किसी भी व्यक्ति के लिए आसान ऑन-रैंप है; जब आप एक स्क्रिप्ट-योग्य CLI और एक हल्की बैकग्राउंड सेवा चाहते हैं तब Ollama जीतता है। दोनों एक ही तरह के ओपन-वेट मॉडल चलाते हैं, इसलिए इस पेज की अवधारणाएँ सीधे स्थानांतरित होती हैं।

खुद जाँचें

0/4
  1. एक फ़्रंटियर क्लाउड मॉडल की तुलना में एक मॉडल को स्थानीय रूप से चलाने का सबसे बड़ा ईमानदार समझौता क्या है?
  2. कौन सा कमांड एक मॉडल को (आवश्यक होने पर) डाउनलोड भी करता है और उसके साथ चैट भी शुरू करता है?
  3. OpenAI-SDK कोड से अपने स्थानीय मॉडल को कॉल करने के लिए, आप क्या सेट करते हैं?
  4. अरबों पैरामीटर वाला मॉडल केवल कुछ GB RAM में क्यों फिट हो सकता है?
Key takeaways
  • स्थानीय = निजता + ऑफ़लाइन + कोई प्रति-टोकन लागत नहीं + नियंत्रण; समझौता एक वास्तविक क्षमता का अंतर और हार्डवेयर सीमाएँ हैं।
  • दो कमांड आपको चालू कर देते हैं: Ollama इंस्टॉल करें, फिर ollama run llama3.2।
  • मूल CLI: pull (डाउनलोड), run (चैट), list, ps, stop, rm — बस इतना ही अधिकांश है।
  • इसे कोड से OpenAI-संगत एंडपॉइंट के माध्यम से कॉल करें: base_url http://localhost:11434/v1, कोई भी गैर-रिक्त api_key।
  • पैरामीटर गणना + क्वांटाइज़ेशन तय करते हैं कि आपकी मशीन एक मॉडल चला सकती है या नहीं — छोटे से शुरू करें, जो सुचारू रूप से चले उस तक आकार बढ़ाएँ।
  • GUI पसंद है? LM Studio वही काम पॉइंट-एंड-क्लिक से करता है और एक स्थानीय OpenAI-संगत सर्वर भी उजागर करता है।

स्रोत और आगे पढ़ें

आगे

  • किसी कार्य के लिए स्थानीय बनाम क्लाउड तय करें → Choosing a Model
  • टूल्स को स्थानीय रूप से भी काम करवाएँ → Tool Use
  • देखें कि मॉडल चलाने में वास्तव में कितना खर्च आता है → Token Economy