AI Models & Assistants
Claude is our core — but the same skills travel. This section widens the lens to the whole AI world: the major assistants, how they differ, when to use which, and the techniques that transfer across all of them.
- Pick the right model for a job without re-learning the field every time
- Move between assistants — ChatGPT, Gemini, Grok, open models — without losing your technique
- Run capable models on your own machine, and know when that is worth it
- Combine Claude with local models and agent frameworks
Start here
If you read one page in this section, read this one. Everything below is a branch off it.
- How to choose a model — a durable framework that outlives any particular release.
Then follow whichever thread matches what you are doing.
The current flagships
The two September 2026 releases at the top of both stacks, read side by side.
- Claude Fable 5.1: what changed and how to migrate — three breaking changes, five betas, cache reads at a quarter of the price
- GPT-6 Astra: the field guide for Claude users — same list price, different bill, Critical-tier cyber classification
Coming from another assistant
You already know one tool and want your habits to carry over.
- ChatGPT for Claude users
- Gemini for Claude users
- Grok for Claude users
- Porting prompts across models — what transfers, what breaks
Comparing before you commit
- Claude vs GPT vs Gemini for coding
- Reasoning models compared
- What AI costs across providers
- Generative media: image, audio, video
Running models yourself
Local models trade some capability for privacy, cost control, and working offline. These pages cover when that trade is worth making.
- Run models locally with Ollama — the practical starting point
- Why a 35 KB system prompt breaks on a local model — context budgets, Ollama's silent middle-of-prompt truncation, and the failure signals to watch
- DeepSeek, Qwen & the open models
- DeepSeek V4-Flash-Vision: first native-vision frontier open weight
- Colibrì: run a 744B MoE from your SSD — expert streaming on 16–32 GB machines, and what it really costs in tok/s
- A private local AI stack
- Claude plus local models — using both, deliberately
Agents beyond Claude
- Local AI agents
- Open-source agent frameworks
- Claude, MCP and local tools
- A2A: the agent-to-agent protocol
- Agent payments: x402, MPP and AgentCore GA — how agents actually pay for things now
- OpenAI Agents API vs Claude Managed Agents — the two hosted agent loops side by side: permissions, vaults, budgets, network policy, sandbox cost
Everything in this section
The full list, including pages added since this index was written.
AI Models & Assistants
Claude is the core here, but the same skills travel. Start with how to choose, then go as deep as you need on any assistant, on running models locally, or on agents.
Die KI-Modell-Landschaft: Die Wahl zwischen Claude, ChatGPT, Gemini & offenen Modellen
Ein robustes Framework, um das richtige KI-Modell für eine Aufgabe auszuwählen — über Claude, ChatGPT, Gemini, Llama, Mistral, Grok und die offenen/lokalen Modelle hinweg — plus welche Fähigkeiten sich auf alle übertragen lassen.
Claude Fable 5.1: What Changed and How to Migrate
Anthropic shipped Claude Fable 5.1 and Mythos 5.1 on September 1, 2026: same $10/$50 price, cache reads cut to $0.25, three breaking API changes (forced tool_choice errors, one-way thinking blocks, append-only history) and five additive betas. The migration field guide for anyone pinning claude-fable-5 or claude-opus-5.
Claude Fable 5 & Mythos 5: Der Flagship-Feldführer
Fable 5 ist Anthropics fähigstes Modell. Sein API refust In-Band (HTTP 200, stop_reason: refusal), hat nur adaptives Denken und gibt nie rohes Denken zurück. Pinnst du ein Top-Tier-Modell, ändert das, wie du Integrationen schreibst. Wann du es statt Opus 4.8 nimmst, das Fallback-Muster, die Prompting-Shifts.
Claude Opus 5: Der Field Guide
Opus 5 wurde am 24. Juli 2026 als Anthropics viertes Modell in zwei Monaten veröffentlicht — gleicher Preis von 5 $/25 $ wie Opus 4.8, aber mehr als doppelter Frontier-Bench-Score, 3× ARC-AGI-3 gegenüber dem nächstbesten Modell und ein neues xhigh/max Effort-Tier. Die Benchmarks, die zählen, die zwei 400-Errors, die naive Migrationen brechen, und wann Opus 5 in deinem Stack Fable 5 ersetzt.
Claude Sonnet 5: Der Feldführer
Sonnet 5 ist Claude Codes neuer Default und der Drop-in-Nachfolger von Sonnet 4.6 — aber drei API-Einschränkungen werden dich bei der Migration mit 400 abweisen, und ein neuer Tokenizer erzeugt ~30% mehr Tokens für denselben Text. Die Preismathematik, das Effort-Remapping (Sonnet 5 medium ≈ Sonnet 4.6 high) und die Prompting-Shifts, die Teams überraschen.
ChatGPT für Claude-Nutzer
Sicher im Umgang mit Claude, aber ChatGPT nötig? Die Unterschiede, die zählen, was sich überträgt und wann man zu welchem greift.
GPT-5.6 & ChatGPT Work für Claude-Nutzer
OpenAI hat am 9. Juli 2026 die GPT-5.6-Familie (Sol, Terra, Luna) und ChatGPT Work ausgeliefert. Was sich für einen Claude-Nutzer wirklich geändert hat — 1,05 Mio. Kontext, ein $1-Tier, ein Agent, der stundenlang läuft, und die Teile des Launches, über die niemand schreibt.
GPT-5.6-August-Update 2026: Effort-Slider, kostenloser Think-Button & die 272K-Preisklippe
Am 6. August 2026 hat OpenAI ein Mid-Cycle-Update für GPT-5.6 ausgeliefert, das die meisten Zusammenfassungen auf 'Sol ist schlauer geworden' reduzierten. Die eigentliche Geschichte: eine sechsstufige Effort-Steuerung, die verändert, wie du einen Request bepreist, ein Think-Button für die kostenlose Stufe, eine Preisklippe bei 272K Tokens, die den gesamten Call neu bepreist, und ein Fast-Modus, der nur auf Sol läuft. Was jedes davon für Claude-Nutzer bedeutet.
OpenAI Astra: Die Feldnotiz zur Vorschau
OpenAIs 'nächstes großes Modell' Astra wurde am 1. August 2026 mit zehn Lean-verifizierten Mathematik-Beweisen und fast keinen Produktspezifikationen vorgestellt. Was tatsächlich bestätigt ist, was noch unbekannt bleibt, und ob ein Claude-Nutzer warten sollte — die ehrliche, belegte Einschätzung.
Codex Agent Plugins & Katalog-Föderation (v0.147.0): Der Praxis-Leitfaden
Am 7. August 2026 veröffentlichte OpenAI Codex CLI v0.147.0 — das Release, das Skills in portable Agent Plugins mit einem vierstufigen Katalog verwandelt, ein Flag --approve-for-me einführt, das nicht das tut, wonach es klingt, --full-auto stillschweigend entfernt und dich in MCP 2026-07-28 opt-in bringt. Was jeder Teil tatsächlich tut, in Claude-Nutzer-Begriffen.
Anmelden mit ChatGPT
OpenAIs neue Identitätsschicht, drei Tage alt. Welche Daten tatsächlich die Grenze überschreiten, was Enterprise-Admins dagegen tun können und wie man sie in der eigenen App akzeptiert, ohne OpenAI einen Fuß in die Tür zu stellen, den man nicht beabsichtigt hat.
KI-Modelle lokal ausführen mit Ollama
Führe Open-Weight-Modelle (Llama, Mistral, Qwen…) auf deinem eigenen Rechner aus — privat, offline, kostenlos im Betrieb — mit Ollama. Einrichtung, CLI und Aufruf aus dem Code.
Claude vs. GPT vs. Gemini fürs Programmieren
Ein Framework (keine Bestenliste) zur Auswahl eines Frontier-Modells fürs Programmieren — die Faktoren, die zählen, und warum ein Eval auf deinem eigenen Repo jeden Benchmark schlägt.
Coding-Agent-CLIs im Vergleich
Claude Code, Codex CLI, Gemini CLI und die quelloffenen Terminal-Agenten — wie das Harness (nicht nur das Modell) über deine Ergebnisse entscheidet und wie du dein Setup mit AGENTS.md portabel hältst.
Supabase Evals — Agent-Benchmark auf echtem Backend
Supabase hat einen Benchmark open-source gestellt, der Claude Code, Codex und OpenCode gegen echte containerisierte Supabase-Stacks laufen lässt — keine Mocks. Hier ist, was er misst, was er darüber herausgefunden hat, wie Modelle wirklich Dokumentation und Skills nutzen, und wie du ihn an einem Abend lokal ausführst.
Apple Foundation Models 3 & der On-Device-LLM-Stack für Claude-Nutzer
Apples Foundation Models der dritten Generation (AFM 3) landeten auf der WWDC 2026 mit einem 3B-Dense-On-Device-Modell, einem 20B-Sparse-MoE, das auf dem iPhone läuft, und einem Swift-nativen Framework, das dir nun erlaubt, deinen eigenen LLM-Anbieter mitzubringen — einschließlich Claude. Was tatsächlich ausgeliefert wurde, die nicht offensichtlichen Mechanismen, und wie es die On-Device-Story für alle verändert, die Claude-Apps ausliefern.
Gemini für Claude-Nutzer
Du beherrschst Claude und brauchst Googles Gemini? Die Unterschiede, die zählen — Gems, Workspace-Integration, riesiger Kontext, multimodal — und was sich übertragen lässt.
Gemini 3.6 Flash, Flash-Lite & Flash Cyber für Claude-Nutzer
Am 21. Juli 2026 sprang Google Gemini 3.5 Pro komplett aus und lieferte stattdessen drei Flash-Tier-Modelle. Echte Preise, echte Benchmarks, die Migrations-Gotchas und die Teile, die die meisten Write-ups verpassen — einschließlich eines Cybersecurity-Fine-Tunes, der Claude Opus 4.6 beim V8-Bug-Hunting schlug.
Gemini 3.7 Flash for Claude Users: Coding-Agent Workhorse at Half Price (Aug 2026)
On 13 August 2026, three weeks after 3.6 Flash, Google shipped Gemini 3.7 Flash at half the introductory price with a 16-point DeepSWE jump. The gotchas most write-ups skip: an expiring intro price, a 3× throughput advantage that matters for agent loops but not chat, and where it still trails Claude Sonnet 5.
Grok für Claude-Nutzer
Fließend in Claude, brauchst aber xAIs Grok? Die Unterschiede, die zählen — Echtzeit-Suche in X/Web, eine OpenAI-kompatible API und der Coding-Agent Grok Build — plus alles, was sich überträgt.
Muse Code + Muse Spark 1.2: Metas Terminal-Coding-Agent
Am 5. August 2026 hat Meta Muse Code veröffentlicht, einen Terminal-Coding-Agent, und Muse Spark 1.2, das Modell, das gemeinsam damit trainiert wurde. Was das Append-only-Event-Log tatsächlich bringt, warum die Contributor-Stufe 12,5× günstiger ist als die Standard-Stufe, wie es sich gegen Claude Code auf Terminal-Bench 2.1 schlägt und welche drei mitgelieferten Skills es sich zu übernehmen lohnt — egal, welchen Agent du nutzt.
Open-Source-Frameworks für KI-Agenten
Eine anbieterneutrale Übersicht der wichtigsten offenen Frameworks zum Bau von LLM-Agenten — LangGraph, LlamaIndex, AutoGen, CrewAI und der minimale Loop-Ansatz — und wie man auswählt.
Native Multi-Agent-APIs: OpenAIs Responses Multi-Agent Beta vs Selbst bauen
Am 9. Juli 2026 hat OpenAI die Responses-API-Multi-Agent-Beta und den Sol Ultra Mode ausgeliefert — der erste Frontier-Anbieter, der 'das Modell spawnt und synthetisiert N Subagenten in einem HTTP-Request' zu einer erstklassigen Primitive gemacht hat. Was tatsächlich ausgeliefert wird, die API-Form, die Kostenrechnung, was Anthropic stattdessen tut und wann die native Primitive einen DIY-Fan-out schlägt.
A2A: Das Agent-zu-Agent-Protokoll
MCP verbindet Agenten mit Tools. A2A verbindet Agenten mit anderen Agenten — über Frameworks, Clouds und Firmen hinweg. Lerne die Agent Card, Tasks, die acht Lebenszyklus-Zustände, Streaming vs. Webhooks und wie A2A mit MCP komponiert.
Agent Payments: x402, MPP and AgentCore GA
How AI agents actually pay for things now — the x402 HTTP-402 protocol, the exact/upto/batch-settlement schemes, facilitators, Amazon Bedrock AgentCore Payments' Aug 2026 GA (payment sessions, Coinbase Bazar MCP, Stripe Privy, Machine Payment Protocol), and how to add a paywall or a spending agent without inventing a wallet.
Prompts zwischen Modellen portieren
Einen Prompt zwischen Claude, GPT, Gemini und offenen Modellen verschieben — was sauber übertragbar ist, was pro Modell anzupassen ist, und ein Migrations-Workflow.
Model-Routing-Muster: Kaskaden, Klassifikatoren und was tatsächlich in Produktion geht
Die Design-Muster, um jede Anfrage an das richtige KI-Modell zu schicken — regel-basiert, Klassifikator, Komplexität, Kaskade, Ensemble, Fallback. Wann welches, was bricht, und die Rezepte, die 2026 tatsächlich in Produktion gehen.
DeepSeek, Qwen & die Welle der offenen Gewichte
Starke Open-Weight-Modelle (DeepSeek, Qwen, Llama, Mistral) haben einen Großteil des Rückstands aufgeholt. Was 'Open Weight' bedeutet, die Kompromisse gegenüber der geschlossenen Spitze und wie man sie einsetzt.
Qwen3.8-Max: Das erste Max-Klasse-Modell mit offenen Gewichten (wenn die Gewichte erscheinen)
3. August 2026: Alibabas Qwen3.8-Max wurde nur per API veröffentlicht, mit einem 2,4T-Parameter-MoE (95B aktiv), 1M-Kontext, dualen OpenAI/Anthropic-Spec-APIs und Benchmark-Werten, die GPT-5.6 Sol Max auf OSWorld schlagen. Was wirklich neu ist, was 'Open Weight' tatsächlich bedeutet, wenn die Hugging-Face-Seite leer ist, und die Sparsity-Mathematik, die Self-Hosting teuer macht.
DeepSeek V4-Flash-Vision: First Native-Vision Frontier Open Weight
On Aug 31 2026 DeepSeek open-sourced V4-Flash-Vision-Exp — a 305B MoE that adds native vision to V4-Flash without hurting text agent scores, matches or beats Claude Opus 4.8 on ApexBench / Agents' Last Exam / ZeroBench at a fraction of the price, and ships MIT. The specific numbers, the hard 384-token-per-image cap most guides ignore, and the concrete way to run it.
Kimi K2 für Claude-Nutzer
Moonshots Kimi K2 ist ein Open-Weight-Agent mit einer Billion Parametern, gebaut für lange Tool-Use-Ketten. Was ihn tatsächlich von Claude unterscheidet — native INT4-Gewichte, 200–300 sequenzielle Tool-Aufrufe, eine freizügige Lizenz — und wann er sich lohnt.
GLM-5.2: Open-Weight-Frontier-Coding-Modell
Z.ais 753B-MoE (~40B aktiv), 1M-Token-Kontext, MIT-lizenziert — schließt bis auf einen Punkt an Claude Opus 4.8 in Long-Horizon-Coding, zu etwa einem Sechstel der API-Kosten. Was IndexShare tatsächlich tut, wie man es lokal ausführt und wo es Claude Code in der Praxis schlägt.
Inkling: Das Open-Weights-Modell von Thinking Machines
Mira Muratis Thinking Machines Lab hat Inkling veröffentlicht — ein multimodales MoE-Modell mit 975 Mrd. Parametern unter Apache 2.0 und einem stufenlosen Thinking-Effort-Regler. Was die Berichterstattung zum Launch falsch verstanden hat, warum das Modell Benchmarks absichtlich verliert und was der Effort-Regler wirklich tut.
Kimi K3: Das weltweit größte Open-Weight-Modell
Das 2,8-Billionen-Parameter-Open-Weight-Modell von Moonshot AI schlägt Claude Opus 4.8 in vielen Benchmarks und führt die Frontend Code Arena an. Was macht es architektonisch anders, wann kippt die Cache-Hit-Preisgestaltung die Kostenrechnung und ob es die Mühe wert ist.
Kimi K3 lokal betreiben: vLLM, DSpark & die echte Hardware-Rechnung
Der endgültige praktische Leitfaden zum Self-Hosting von Moonshots 2,8T-Open-Weight-Modell Kimi K3 im Jahr 2026. Was DSpark-Speculative-Decoding tatsächlich tut, Mindesthardware (1× DGX B300 oder 16× DGX Spark), die exakten vLLM-Serve-Befehle, die Prefill/Decode-Asymmetrie, vor der niemand warnt, und wann Hosted-Inferenz Ihr eigenes Rack unterbietet.
Ein Blick in Grok Build: Ein offenes Agenten-Harness lesen
xAI hat den vollständigen Rust-Quellcode seines Coding-Agenten unter Apache 2.0 veröffentlicht — die Agentenschleife, die Werkzeugschicht, die TUI und das Erweiterungssystem. Was die Crate-Karte über den Bau von Agenten lehrt, warum 'Open Source' hier quelloffen-verfügbar bedeutet und was der noch im Baum enthaltene Datensammler-Code verrät.
Poolside Laguna: Open-Weight-Coding-Modelle, die über ihrer Klasse spielen
Die Laguna-Familie von Poolside AI (XS 2.1, S 2.1, M.1) — MoE-Coding-Modelle mit 3B–23B aktiven Parametern, 1M-Token-Kontext, OpenMDW-1.1-Lizenz. Was das S 2.1 mit 8B aktiven Parametern wirklich schlägt, warum das XS 2.1 mit 3B aktiven Parametern auf einem MacBook läuft, die erste bekannte RL-in-FP8-Trainingspipeline und wann man es Claude, GLM-5.2 oder Kimi K3 vorziehen sollte.
Generative Medien: Bild-, Audio- & Video-KI
Über den Text-Chat hinaus — eine Landkarte der KI für Bilder, Video, Stimme und Musik: die wichtigsten Tools, die dauerhaften Fähigkeiten und die Rechte/Ethik, die zählen.
MiniMax H3 (Hailuo 3.0): Das Open-Weight-Omni-Videomodell
MiniMax hat einen 33B Single-Stream-Transformer als Open Source veröffentlicht, der in einem Durchlauf 4–15s 2K-Video mit nativem Stereo-Audio generiert. Die Lizenz blockiert leise Self-Hosting in den USA/EU/UK/Korea, die offene Basis ist 768p (nicht 2K), und ~13B von 33B Parametern sind AdaLN-Branches, die man beim Inferenzieren überspringen kann. Was H3 wirklich ist, was es kostet und wann es die geschlossenen Video-APIs schlägt.
Was KI wirklich kostet (über Anbieter hinweg)
Ein dauerhaftes Framework zum Vergleich von KI-Kosten über Anbieter hinweg — die Preis-Archetypen, wie man eine Arbeitslast schätzt, die Hebel zur Senkung der Rechnung und wann offen/lokal gewinnt.
Warum KI-Agenten Token verbrennen (und wie man die Rechnung deckelt)
Agentische Läufe kosten das 50–1000-Fache eines Chats — nicht weil das Modell dümmer ist, sondern wegen der Kontext-Lawine. Der Mechanismus, die überraschenden Zahlen und die vier Hebel, die die Rechnung tatsächlich senken — über Claude, GPT, Gemini und offene Modelle hinweg.
Lokale KI-Agenten bauen
Autonome Agenten, die vollständig auf Ihrem eigenen Rechner mit einem lokalen Open-Weight-Modell laufen — privat, offline, kostenlos im Betrieb. Die Architektur, die Kompromisse und wie Sie anfangen.
Claude + lokale Modelle: Hybrid-Muster
Bringe Claude und lokale Open-Weight-Modelle zur Synergie — Router, Draft-then-Refine, Privacy-Redaction, Massen-Vorverarbeitung — für das Reasoning der Spitzenklasse bei der Privatsphäre und den Kosten des Lokalen.
KI-Gateways: LiteLLM, OpenRouter, Portkey, Vercel
Ein Produktions-KI-Gateway ist der fehlende Router zwischen deiner App und jedem Modell — Claude, GPT, Gemini, Llama. Vergleiche LiteLLM, OpenRouter, Portkey und Vercel AI Gateway und leite dann Claude Code über deinen eigenen Proxy.
Lokale Coding-Agenten (und wie sie mit Claude zusammenspielen)
Coding-Agenten, die auf deinem Rechner laufen und dein Repo bearbeiten — Aider, Cline, Continue, OpenHands, Claude Code — angetrieben von Claude für Qualität oder einem lokalen Modell für Datenschutz.
Claude mit lokalen Tools & Agenten über MCP verbinden
Das Model Context Protocol lässt Claude Tools, Daten und Agenten orchestrieren, die privat auf deiner eigenen Maschine laufen — die Synergie aus Claude-als-Gehirn und lokalen Fähigkeiten. Füge einen lokalen MCP-Server hinzu oder baue selbst einen.
Einen privaten lokalen KI-Stack aufbauen (Ende-zu-Ende)
Alles zusammenführen: ein lokales Modell (Ollama) + ein modellagnostischer Agent + Tools über einen lokalen MCP-Server — ein privater Assistent auf deinem eigenen Rechner, mit Claude als optionaler intelligenter Schicht.
Lokaler Agent oder Claude? Ein Entscheidungsleitfaden
Vollständig lokaler Agent, Claude-betrieben oder hybrid? Die Faktoren, die es entscheiden — Datenschutz, Aufgabenschwierigkeit, Kosten, Latenz, Zuverlässigkeit — und warum hybrid oft gewinnt.
Lokale & hybride Agenten absichern
Ein Agent, der Dateien bearbeiten und Befehle ausführen kann, ist mächtig und gefährlich. Least Privilege, Sandboxing, menschliche Freigabe, Abwehr von Prompt Injection, Budget-Obergrenzen — wie man Agenten sicher betreibt.
Reasoning-Modelle im Vergleich
Thinking-Budgets und Reasoning-Aufwand bei Claude, GPT, Gemini, DeepSeek und Qwen — wann es sich lohnt, Tokens fürs Nachdenken auszugeben, und wann nicht.
Full-Duplex-Voice-AI: Warum Sprachagenten plötzlich real wurden
GPT-Live und die neuen speech-native Modelle hören und sprechen gleichzeitig. Was Full-Duplex verändert, wie es funktioniert und wie die Voice-AI-Landschaft heute aussieht.
Claude Voice mit Opus & Sonnet (Juli 2026): Reasoning-First Voice vs. GPT-Live
Anthropic hat Claude Voice am 23. Juli 2026 für Opus, Sonnet und Connected Apps geöffnet — hat aber am turn-basierten Stack festgehalten. Was sich tatsächlich geändert hat, wann man mitten im Gespräch das Modell wechselt und wie sich diese Design-Wette von OpenAIs Full-Duplex-GPT-Live unterscheidet.
Token-Geschwindigkeit: Warum KI-Inferenz plötzlich 10-15× schneller wurde
Wafer-Scale-Chips und LPUs bedienen Frontier-Modelle mit Hunderten von Tokens pro Sekunde. Was die Inferenzgeschwindigkeit wirklich begrenzt, das neue Hardware-Rennen und warum schnelle Tokens Agents, Sprache und Reasoning verändern.
Computer-Use-Agents im Vergleich
Claude, GPT und Gemini können jetzt alle einen Bildschirm steuern – aber jeder legt einen anderen Aktionsraum, Koordinaten-Vertrag und Sicherheits-Gate offen. Was tatsächlich bricht und wie du eine Schleife baust, die es übersteht.
Shared-Login-Browser für KI-Agenten: das ego-lite-Muster
Eine neue Browser-Klasse — am besten von ego lite verkörpert, das am 24. Juli 2026 die Spitze der GitHub-Trending-Liste erreichte — lässt Claude Code, Codex, Cursor und jeden anderen Coding-Agenten eine isolierte Chromium-Session steuern, die deine echten Logins erbt. Was Spaces und semantische Snapshots wirklich lösen, warum das Playwright für Agenten-Arbeit untergräbt und der Sicherheitspreis, deinen Session-Cookies einen autonomen Prozess mitzuteilen.
Cloudflare Kitesurf: The First Browser Runtime Built for AI Agents (Not Humans)
On August 6, 2026 Cloudflare launched Kitesurf, a stateless, agent-first browser that runs entirely in V8 isolates on Workers. It uses 3-7x less CPU and memory than Chromium on common agent tasks — at the cost of ~1.7x wall-clock time. Written in Rust, using Firefox's CSS parser (Stylo) and the Blitz rendering engine, drop-in compatible with Puppeteer/Playwright via the Chrome DevTools Protocol. This page: what changed, when to reach for it instead of headless Chrome, how to wire it into Claude Code / Codex / your MCP client, and the four things it flat-out can't do yet.
SKILL.md: Der agentenübergreifende offene Standard
Eine SKILL.md-Datei, zweiunddreißig Agenten. Was der offene Standard für Agent Skills tatsächlich ist, wie Progressive Disclosure den Kontext günstig hält, was Portabilität bricht und wie du einen Skill schreibst, der unverändert in Claude Code, Codex, Gemini CLI und Cursor läuft.
Colibrì: Run a 744B MoE From Your SSD (and What It Really Costs You)
Colibrì is a pure-C, zero-dependency engine that runs GLM-5.2 (744B), Kimi K3 (2.8T), DeepSeek V4.1 Flash and six other frontier MoE models on a 16–32 GB machine by keeping the dense layers in RAM and streaming the routed experts from NVMe. This page explains the memory hierarchy, the numbers that decide whether it is usable for you (0.05 to 6.8 tok/s), the SSD-wear and speculative-decoding gotchas, and the exact commands to get a first token.
OpenAI Agents API vs Claude Managed Agents: The Hosted Agent Loop, Compared
On September 10, 2026 OpenAI put the Codex harness behind a single API call: the Agents API public beta — durable sessions, hosted or self-hosted sandboxes, automatic compaction, tool search, subagents. Anthropic has run the same shape since April as Managed Agents. Both use the same four primitives; they differ on permissions, secrets, budgets, network policy and what the sandbox costs. The side-by-side, the request shapes, the six gotchas, and when to pick which.
Why a 35 KB System Prompt Breaks on a Local Model
Moving a big Claude/GPT system prompt to Ollama or another local runtime: the context-budget math, Ollama's silent middle-of-prompt truncation, the failure signals of context exhaustion, and the restructuring that actually works.