टोकन, कॉन्टेक्स्ट और प्राइसिंग
- Anthropic के अपने टूलिंग से टोकन सही तरीके से गिनें (किसी दूसरे मॉडल के टोकनाइज़र से नहीं)
- max_tokens को कॉन्टेक्स्ट विंडो से अलग पहचानें — और यह अंतर क्यों मायने रखता है
- प्रति-मॉडल दरों पर इनपुट + आउटपुट टोकन से API लागत का अनुमान लगाएं
- गुणवत्ता खोए बिना लागत घटाएं: सही आकार चुनें, कैश करें, छाँटें, बैच करें
API पर लागत और सीमाएं सभी टोकन में मापी जाती हैं (एक शब्द का लगभग ¾)। तीन चीज़ें सही करनी हैं।
1. टोकन सही तरीके से गिनें
अंदाज़ा न लगाएं, और किसी दूसरे मॉडल के टोकनाइज़र का उपयोग न करें (उदा. tiktoken) — टोकन गिनती हर मॉडल परिवार में अलग होती है। किसी रिक्वेस्ट को भेजने से पहले उसे मापने के लिए Anthropic के token counting एंडपॉइंट/SDK हेल्पर का उपयोग करें।
- मोटे तौर पर योजना का नियम: ~750 शब्द ≈ ~1,000 टोकन (एक टोकन मोटे तौर पर एक शब्द का ¾ होता है)।
2. max_tokens ≠ कॉन्टेक्स्ट विंडो
इन दो सीमाओं को आसानी से भ्रमित किया जा सकता है, लेकिन ये अलग-अलग चीज़ों को नियंत्रित करती हैं।
| सीमा | यह किसे सीमित करती है | इसे कब बदलें |
|---|---|---|
max_tokens | जवाब की लंबाई (केवल आउटपुट) | अगर आउटपुट कट जाए तो इसे बढ़ाएं |
| कॉन्टेक्स्ट विंडो | इनपुट + आउटपुट के लिए कुल बजट | बड़े इनपुट से आउटपुट के लिए कम जगह बचती है |
- max_tokens को उतना सेट करें जितना टास्क को चाहिए। बहुत कम होने पर जवाब कट जाता है। बेवजह ज़्यादा होने पर अधिक लागत नहीं आती — आप केवल असल में जनरेट हुए टोकन के लिए भुगतान करते हैं — लेकिन इससे जवाब भटकने लग सकते हैं।
3. लागत का अनुमान लगाएं
आपसे इनपुट टोकन + आउटपुट टोकन के लिए, प्रति-मॉडल दरों पर बिलिंग होती है (Opus > Sonnet > Haiku)। एक त्वरित अनुमान:
cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)
मौजूदा दरें आधिकारिक प्राइसिंग पेज से प्राप्त करें — हम जानबूझकर उन्हें यहाँ हार्ड-कोड नहीं करते।
लागत घटाना (गुणवत्ता खोए बिना)
Guided walkthrough1 of 4
- Sonnet से शुरू करें; कठिन हिस्सों के लिए Opus बचाकर रखें। Choosing a Model (/docs/api/choosing-a-model) देखें।
- कॉल्स के बीच एक स्थिर प्रॉम्प्ट प्रीफ़िक्स का पुनः उपयोग करें। Prompt Caching (/docs/api/prompt-caching) देखें।
- केवल वही कॉन्टेक्स्ट भेजें जो मायने रखता है। यहीं RAG (/docs/foundations/rag) भी मदद करता है।
- ऐसे जॉब्स को बैच करें जहाँ लेटेंसी मायने नहीं रखती।
अधिक रणनीति Cost & Latency Tradeoffs में।
खुद को परखें
0/4- सब कुछ टोकन में मापा जाता है (एक शब्द का लगभग ¾); ~750 शब्द ≈ ~1,000 टोकन।
- Anthropic के अपने टूलिंग से टोकन गिनें — कभी किसी दूसरे मॉडल के टोकनाइज़र से नहीं।
- max_tokens जवाब को सीमित करता है; कॉन्टेक्स्ट विंडो कुल इनपुट + आउटपुट बजट है।
- बिलिंग = इनपुट टोकन + आउटपुट टोकन, प्रति-मॉडल दरों पर (Opus > Sonnet > Haiku)।
- मॉडल का सही आकार चुनकर, प्रीफ़िक्स कैश करके, इनपुट छाँटकर, और बैचिंग करके लागत घटाएं।