Zum Hauptinhalt springen

Tokens, Kontext & Preise

Einsteiger
What you'll learn
  • Tokens korrekt zählen mit Anthropics eigenem Werkzeug (nicht dem Tokenizer eines anderen Modells)
  • max_tokens vom Kontextfenster unterscheiden — und warum der Unterschied wichtig ist
  • API-Kosten aus Eingabe- + Ausgabe-Tokens zu modellspezifischen Tarifen abschätzen
  • Kosten senken ohne Qualitätsverlust: richtig dimensionieren, cachen, kürzen, batchen

Kosten und Limits auf der API werden alle in Tokens gemessen (~¾ eines Wortes). Drei Dinge, die man richtig machen muss.

1. Tokens korrekt zählen

Rate nicht, und verwende nicht den Tokenizer eines anderen Modells (z. B. tiktoken) — die Token-Anzahl unterscheidet sich je nach Modellfamilie. Nutze Anthropics Token-Counting-Endpunkt/SDK-Helfer, um eine Anfrage zu messen, bevor du sie sendest.

Pro tip
  • Grobe Planungsregel: ~750 Wörter ≈ ~1.000 Tokens (ein Token entspricht grob ¾ eines Wortes).

2. max_tokens ≠ Kontextfenster

Diese beiden Limits werden leicht verwechselt, aber sie steuern unterschiedliche Dinge.

LimitWas es begrenztWann man es ändert
max_tokensDie Länge der Antwort (nur Ausgabe)Erhöhen, wenn die Ausgabe abgeschnitten wird
KontextfensterGesamtbudget für Eingabe + AusgabeGroße Eingaben lassen weniger Raum für Ausgabe
Watch out
  • Setze max_tokens auf das, was die Aufgabe braucht. Zu niedrig schneidet die Antwort ab. Unnötig hoch kostet nicht mehr — du zahlst nur für tatsächlich erzeugte Tokens — kann aber dazu führen, dass Antworten ausschweifen.

3. Kosten abschätzen

Dir werden Eingabe-Tokens + Ausgabe-Tokens berechnet, zu modellspezifischen Tarifen (Opus > Sonnet > Haiku). Eine schnelle Schätzung:

cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)

Hol dir die aktuellen Tarife von der offiziellen Preisseite — wir codieren sie hier bewusst nicht fest.

Kosten senken (ohne Qualitätsverlust)

Guided walkthrough1 of 4
  1. Starte mit Sonnet; reserviere Opus für die schwierigen Teile. Siehe Ein Modell wählen (/docs/api/choosing-a-model).

Mehr Strategie unter Kosten- & Latenz-Abwägungen.

Überprüfe dich selbst

0/4
  1. Du planst eine Anfrage und möchtest ihre Token-Anzahl vor dem Senden wissen. Was solltest du verwenden?
  2. Deine Antwort wird immer wieder mitten im Satz abgeschnitten. Welche Einstellung änderst du?
  3. Wie wird dir auf der API abgerechnet?
  4. Was ist der beste erste Schritt, um Kosten ohne Qualitätsverlust zu senken?
Key takeaways
  • Alles wird in Tokens gemessen (~¾ eines Wortes); ~750 Wörter ≈ ~1.000 Tokens.
  • Zähle Tokens mit Anthropics eigenem Werkzeug — niemals mit dem Tokenizer eines anderen Modells.
  • max_tokens begrenzt die Antwort; das Kontextfenster ist das Gesamtbudget für Eingabe + Ausgabe.
  • Abrechnung = Eingabe-Tokens + Ausgabe-Tokens zu modellspezifischen Tarifen (Opus > Sonnet > Haiku).
  • Senke Kosten, indem du das Modell richtig dimensionierst, Präfixe cachst, Eingaben kürzt und batchst.

Weiter