मुख्य कंटेंट तक स्किप करें

टोकन, कॉन्टेक्स्ट और प्राइसिंग

शुरुआती
What you'll learn
  • Anthropic के अपने टूलिंग से टोकन सही तरीके से गिनें (किसी दूसरे मॉडल के टोकनाइज़र से नहीं)
  • max_tokens को कॉन्टेक्स्ट विंडो से अलग पहचानें — और यह अंतर क्यों मायने रखता है
  • प्रति-मॉडल दरों पर इनपुट + आउटपुट टोकन से API लागत का अनुमान लगाएं
  • गुणवत्ता खोए बिना लागत घटाएं: सही आकार चुनें, कैश करें, छाँटें, बैच करें

API पर लागत और सीमाएं सभी टोकन में मापी जाती हैं (एक शब्द का लगभग ¾)। तीन चीज़ें सही करनी हैं।

1. टोकन सही तरीके से गिनें

अंदाज़ा न लगाएं, और किसी दूसरे मॉडल के टोकनाइज़र का उपयोग न करें (उदा. tiktoken) — टोकन गिनती हर मॉडल परिवार में अलग होती है। किसी रिक्वेस्ट को भेजने से पहले उसे मापने के लिए Anthropic के token counting एंडपॉइंट/SDK हेल्पर का उपयोग करें।

Pro tip
  • मोटे तौर पर योजना का नियम: ~750 शब्द ≈ ~1,000 टोकन (एक टोकन मोटे तौर पर एक शब्द का ¾ होता है)।

2. max_tokens ≠ कॉन्टेक्स्ट विंडो

इन दो सीमाओं को आसानी से भ्रमित किया जा सकता है, लेकिन ये अलग-अलग चीज़ों को नियंत्रित करती हैं।

सीमायह किसे सीमित करती हैइसे कब बदलें
max_tokensजवाब की लंबाई (केवल आउटपुट)अगर आउटपुट कट जाए तो इसे बढ़ाएं
कॉन्टेक्स्ट विंडोइनपुट + आउटपुट के लिए कुल बजटबड़े इनपुट से आउटपुट के लिए कम जगह बचती है
Watch out
  • max_tokens को उतना सेट करें जितना टास्क को चाहिए। बहुत कम होने पर जवाब कट जाता है। बेवजह ज़्यादा होने पर अधिक लागत नहीं आती — आप केवल असल में जनरेट हुए टोकन के लिए भुगतान करते हैं — लेकिन इससे जवाब भटकने लग सकते हैं।

3. लागत का अनुमान लगाएं

आपसे इनपुट टोकन + आउटपुट टोकन के लिए, प्रति-मॉडल दरों पर बिलिंग होती है (Opus > Sonnet > Haiku)। एक त्वरित अनुमान:

cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)

मौजूदा दरें आधिकारिक प्राइसिंग पेज से प्राप्त करें — हम जानबूझकर उन्हें यहाँ हार्ड-कोड नहीं करते।

लागत घटाना (गुणवत्ता खोए बिना)

Guided walkthrough1 of 4
  1. Sonnet से शुरू करें; कठिन हिस्सों के लिए Opus बचाकर रखें। Choosing a Model (/docs/api/choosing-a-model) देखें।

अधिक रणनीति Cost & Latency Tradeoffs में।

खुद को परखें

0/4
  1. आप एक रिक्वेस्ट की योजना बना रहे हैं और उसे भेजने से पहले उसकी टोकन गिनती जानना चाहते हैं। आपको क्या उपयोग करना चाहिए?
  2. आपका जवाब बार-बार वाक्य के बीच में ही कट जाता है। आप कौन सी सेटिंग बदलते हैं?
  3. API पर आपकी बिलिंग कैसे होती है?
  4. गुणवत्ता खोए बिना लागत घटाने के लिए सबसे अच्छा पहला कदम कौन सा है?
Key takeaways
  • सब कुछ टोकन में मापा जाता है (एक शब्द का लगभग ¾); ~750 शब्द ≈ ~1,000 टोकन।
  • Anthropic के अपने टूलिंग से टोकन गिनें — कभी किसी दूसरे मॉडल के टोकनाइज़र से नहीं।
  • max_tokens जवाब को सीमित करता है; कॉन्टेक्स्ट विंडो कुल इनपुट + आउटपुट बजट है।
  • बिलिंग = इनपुट टोकन + आउटपुट टोकन, प्रति-मॉडल दरों पर (Opus > Sonnet > Haiku)।
  • मॉडल का सही आकार चुनकर, प्रीफ़िक्स कैश करके, इनपुट छाँटकर, और बैचिंग करके लागत घटाएं।

आगे