Tokens, Kontext & Preise
- Tokens korrekt zählen mit Anthropics eigenem Werkzeug (nicht dem Tokenizer eines anderen Modells)
- max_tokens vom Kontextfenster unterscheiden — und warum der Unterschied wichtig ist
- API-Kosten aus Eingabe- + Ausgabe-Tokens zu modellspezifischen Tarifen abschätzen
- Kosten senken ohne Qualitätsverlust: richtig dimensionieren, cachen, kürzen, batchen
Kosten und Limits auf der API werden alle in Tokens gemessen (~¾ eines Wortes). Drei Dinge, die man richtig machen muss.
1. Tokens korrekt zählen
Rate nicht, und verwende nicht den Tokenizer eines anderen Modells (z. B. tiktoken) — die Token-Anzahl unterscheidet sich je nach Modellfamilie. Nutze Anthropics Token-Counting-Endpunkt/SDK-Helfer, um eine Anfrage zu messen, bevor du sie sendest.
- Grobe Planungsregel: ~750 Wörter ≈ ~1.000 Tokens (ein Token entspricht grob ¾ eines Wortes).
2. max_tokens ≠ Kontextfenster
Diese beiden Limits werden leicht verwechselt, aber sie steuern unterschiedliche Dinge.
| Limit | Was es begrenzt | Wann man es ändert |
|---|---|---|
max_tokens | Die Länge der Antwort (nur Ausgabe) | Erhöhen, wenn die Ausgabe abgeschnitten wird |
| Kontextfenster | Gesamtbudget für Eingabe + Ausgabe | Große Eingaben lassen weniger Raum für Ausgabe |
- Setze max_tokens auf das, was die Aufgabe braucht. Zu niedrig schneidet die Antwort ab. Unnötig hoch kostet nicht mehr — du zahlst nur für tatsächlich erzeugte Tokens — kann aber dazu führen, dass Antworten ausschweifen.
3. Kosten abschätzen
Dir werden Eingabe-Tokens + Ausgabe-Tokens berechnet, zu modellspezifischen Tarifen (Opus > Sonnet > Haiku). Eine schnelle Schätzung:
cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)
Hol dir die aktuellen Tarife von der offiziellen Preisseite — wir codieren sie hier bewusst nicht fest.
Kosten senken (ohne Qualitätsverlust)
Guided walkthrough1 of 4
- Starte mit Sonnet; reserviere Opus für die schwierigen Teile. Siehe Ein Modell wählen (/docs/api/choosing-a-model).
- Verwende ein stabiles Prompt-Präfix über mehrere Aufrufe hinweg wieder. Siehe Prompt-Caching (/docs/api/prompt-caching).
- Sende nur den Kontext, der zählt. Hier hilft auch RAG (/docs/foundations/rag).
- Batche Jobs, bei denen Latenz keine Rolle spielt.
Mehr Strategie unter Kosten- & Latenz-Abwägungen.
Überprüfe dich selbst
0/4- Alles wird in Tokens gemessen (~¾ eines Wortes); ~750 Wörter ≈ ~1.000 Tokens.
- Zähle Tokens mit Anthropics eigenem Werkzeug — niemals mit dem Tokenizer eines anderen Modells.
- max_tokens begrenzt die Antwort; das Kontextfenster ist das Gesamtbudget für Eingabe + Ausgabe.
- Abrechnung = Eingabe-Tokens + Ausgabe-Tokens zu modellspezifischen Tarifen (Opus > Sonnet > Haiku).
- Senke Kosten, indem du das Modell richtig dimensionierst, Präfixe cachst, Eingaben kürzt und batchst.