Die KI-Modell-Landschaft: Die Wahl zwischen Claude, ChatGPT, Gemini & offenen Modellen
Der Kern von AILmanac ist Claude — aber die Fähigkeiten reisen mit. Dieselben Gewohnheiten beim Prompting, Context-Engineering, Tool-Use und bei Evals funktionieren auf nahezu jedem modernen Modell. Diese Seite weitet den Blick auf das gesamte Feld: Wer die wichtigsten Akteure sind, wie man für eine Aufgabe auswählt und was übertragbar ist, egal welches Modell du verwendest.
- Kenne die wichtigsten KI-Assistenten & Modelle und welcher Archetyp jeder ist
- Nutze ein wiederholbares Framework, um ein Modell für eine konkrete Aufgabe auszuwählen — nicht nach Hype
- Sieh, welche Fähigkeiten sich auf jedes Modell übertragen lassen (die meisten davon)
- Wisse, welche Fakten schnell veralten — und wo du die aktuelle Wahrheit prüfst
Die wichtigsten Akteure (nach Archetyp, nicht nach Ranking)
Denke in Archetypen — die Rankings wechseln, die Archetypen sind stabil:
- Anthropic — Claude · Frontier-Closed-Modell. Bekannt für Coding, agentische/Tool-Nutzung, Long-Context-Reasoning und eine Safety-First-Haltung. (Der gesamte Rest dieser Seite geht hier in die Tiefe.)
- OpenAI — ChatGPT / GPT · Frontier-Closed-Modell mit dem größten Consumer-Ökosystem und einem sehr breiten, multimodalen Funktionsumfang.
- Google — Gemini · Frontier-Closed-Modell, tief in Googles Produkte und Daten verdrahtet, mit sehr großen Context-Fenstern.
- Meta — Llama · Open-Weight: Du kannst es herunterladen und selbst hosten. Das Rückgrat eines Großteils des lokalen/offenen Ökosystems.
- Mistral · Open-Weight + API, europäisch, auf Effizienz ausgerichtet.
- xAI — Grok · Closed, integriert mit X, setzt auf Echtzeit-Signale.
- DeepSeek / Qwen (Alibaba) · starke Open-Weight-Modelle, bekannt für Leistung pro Kosten; beliebt fürs Self-Hosting.
- Die größte praktische Weggabelung ist CLOSED Frontier (beste rohe Leistungsfähigkeit, nur gehostet) vs. OPEN-WEIGHT (self-hostbar, privat, anpassbar, im großen Maßstab oft günstiger im Betrieb).
- Kaufe nicht nach Leaderboard ein. Der einzige Benchmark, der zählt, ist DEINE Aufgabe auf DEINEN Daten.
Wie man ein Modell für eine Aufgabe auswählt
Guided walkthrough1 of 6
- Was muss es leisten, und was ist nicht verhandelbar: Datenschutz (dürfen Daten dein Netzwerk verlassen?), Budget, Latenz, maximaler Context, regulierte Domäne, On-Device-Anforderung.
- Brauchst du die absolute Spitzenleistung ohne Infrastruktur? Ein Closed-Frontier-Modell (Claude / GPT / Gemini). Brauchst du Privatsphäre, Self-Hosting, starke Anpassung oder niedrigste Betriebskosten im großen Maßstab? Ein Open-Weight-Modell (Llama / Mistral / Qwen / DeepSeek), das du selbst hostest.
- Wähle ein paar, die plausibel zu den Constraints passen — zermartere dir nicht den Kopf; du wirst sie testen.
- 10-50 reale Fälle mit bekannten guten Antworten. Lass jeden Kandidaten laufen. Das schlägt jedes öffentliche Leaderboard für deinen Anwendungsfall.
- Multipliziere Kosten und Geschwindigkeit pro Aufruf mit deinem erwarteten Traffic. Das 'beste' Modell kann das falsche sein, wenn es das 10-Fache kostet für einen 2-%-Qualitätsgewinn, den du nicht brauchst.
- Lass es erneut laufen, wenn ein neues Modell erscheint. Der Wechsel ist günstig, wenn du ein Eval hast; ohne Eval ist es ein Münzwurf.
Anbieterneutrales System-Prompt-Skelett (funktioniert auf jedem Modell)
You are a {role}.
Goal: {one sentence}.
Rules:
- Use ONLY the provided context; if the answer isn't there, say "I don't know".
- Output: {exact format / schema}.
Context:
{context}
Task: {task}Was sich auf (fast) jedes Modell überträgt
Der Grund, warum es sich überall auszahlt, Claude gut zu lernen — diese Fähigkeiten sind portierbar:
- Prompting-Struktur — klare Rolle, explizite Aufgabe, Beispiele, Ausgabeformat → Prompting-Grundlagen
- Context-Engineering — entscheiden, was ins Fenster kommt → Grundlagen
- Tool-Use / Function Calling — das Muster ist über Anbieter hinweg nahezu identisch → Tool-Use
- Retrieval (RAG) — Antworten in deinen Daten verankern → RAG
- Evals — Qualität messen, damit du Modelle ehrlich vergleichen kannst → Evals
- Strukturierte Ausgabe — Ergebnisse maschinenlesbar machen → Strukturierte Ausgabe
Was sich NICHT sauber übertragen lässt: exakte API-Formen, Details des Tool-Calling-JSON, Token-Limits, Preise und das Safety-/Verweigerungsverhalten — prüfe das immer pro Anbieter erneut.
Vokabular der Landschaft
Drücke Enter oder die Leertaste, um die Karte umzudrehen. Nutze die Pfeiltasten links und rechts, um zwischen den Karten zu wechseln.Begriff angezeigt.1 / 4
Teste dich selbst
0/3- Denke in Archetypen (Closed-Frontier vs. Open-Weight); die Rankings ändern sich ständig, die Archetypen nicht.
- Wähle nach Constraints + einem winzigen Eval auf deinen eigenen Daten — niemals nach Leaderboard-Hype.
- Die meisten Fähigkeiten (Prompting, Context, Tools, RAG, Evals) übertragen sich auf jedes Modell — deshalb zahlt es sich überall aus, bei Claude in die Tiefe zu gehen.
- Namen, Preise, Limits und Benchmarks veralten schnell — verifiziere die aktuellen Details an der Quelle.
Quellen & weiterführende Literatur
- Anthropic — Modellübersicht — Claudes aktuelle Modellpalette.
- OpenAI — Modelle · Google — Gemini-Modelle · Meta — Llama · Mistral — Modelle — die jeweils eigene, aktuelle Quelle der Wahrheit jedes Anbieters.
- Artificial Analysis — unabhängige, häufig aktualisierte Vergleiche von Leistung/Preis/Geschwindigkeit.
- Ollama · LM Studio — Open-Weight-Modelle lokal ausführen.
Weiter
- Gehe beim Kern in die Tiefe → Welches Claude sollte ich verwenden?
- Mache deine Wahl messbar → Evals
- Die Fähigkeiten, die mitreisen → Prompting-Grundlagen · Grundlagen