Prompt Injection erklärt
Direkte und indirekte Injektion — bösartige Anweisungen, die in Inhalten versteckt sind, die die KI liest.
Agenten & Werkzeuge absichern
Least Privilege, Sandboxing, das Confused-Deputy-Problem und Human-in-the-Loop.
Autonome Läufe härten
Headless-/CI-Läufe absperren, damit ein Agent weder Geheimnisse noch die Produktion berühren kann.
Code von Drittanbietern prüfen
Plugins, Skills und MCP-Server können ausführbaren Code mitbringen — prüfe ihn, bevor du ihm vertraust.
Agent-Skills prüfen, bevor du sie installierst
Eine SKILL.md und ein eine Woche altes GitHub-Konto genügen, um einen Skill zu veröffentlichen. So wird die Skill-Lieferkette angegriffen – und so prüfst du, bevor du vertraust.
Graumarkt-KI-Proxys ("Poison Claude")
Jemand in deiner Organisation zahlt heimlich 10 % des Listenpreises für Claude Opus. Der Haken: Jeder Prompt läuft zuerst über den Server eines Fremden. So funktioniert die Masche und so entdeckst du sie.
Verantwortungsvolle Nutzung, Ethik & Verifikation
Die Autonomie-Leiter, die Verifikations-Haltung, Bias und Menschen im Entscheidungsprozess halten.
MCP-Server absichern: OAuth, Audience-Bindung & der verwirrte Stellvertreter
Warum entfernte MCP-Server OAuth 2.1 brauchen, wie die Audience-Bindung von Tokens die dienstübergreifende Token-Wiederverwendung stoppt und warum Token-Durchreichung verboten ist.
MCP Tool Poisoning, Rug Pulls & Agentjacking
MCP mischt Anweisungen und Daten im selben Kanal — der Tool-Beschreibung. Angreifer waffnen das. Hier ist, wie Tool Poisoning, Rug Pulls, Tool Shadowing und Agentjacking in der Praxis funktionieren, und die Abwehrmaßnahmen, die standhalten.
Unsichtbare-Kommentar-MCP-Angriffe und der Confused-Deputy-PR-Reviewer
Am 21. Juli 2026 hat Manifold Security offengelegt, dass Microsofts offizieller Azure-DevOps-MCP-Server ohne Spotlighting auf repo_get_pull_request_by_id ausgeliefert wird — was einem Angreifer erlaubt, einen HTML-Kommentar in eine PR-Beschreibung zu platzieren, der im Web-UI unsichtbar ist, aber jedem KI-Agenten, der ihn reviewt, wortgleich zugestellt wird. Der Agent, der als Opfer läuft, exfiltriert Daten aus Projekten, die er direkt nie erreichen konnte. Anatomie des Confused-Deputy-Musters, was Spotlighting tatsächlich tut und das Runtime-Visibility-Prinzip, das halten muss, wenn Guardrails scheitern.
GhostSplice: Der kanalübergreifende MCP-Angriff, der die Compliance verdoppelt
Am 11. August 2026 hat die ASSET Research Group GhostSplice offengelegt — einen MCP-Angriff, der niemals eine vollständige bösartige Anweisung an einer einzigen Stelle platziert. Er teilt die Anfrage auf eine Tool-Beschreibung und zwei Ergebnis-Payloads auf, die einzeln unauffällig wirken; der Agent setzt sie im Arbeitsspeicher zusammen, wo kein Filter zuschaut. Die Compliance über elf API-Modelle hat sich ungefähr verdoppelt (42% → 82%); drei Modelle, die Einzel-Requests verweigerten, gingen bei gesplitteten auf 100%. Der Mechanismus, die Zahlen, die Client-Varianz (90% unter Cursor vs. 0% unter Claude Code beim gleichen Modell auf demselben Server) und was in Tests tatsächlich standgehalten hat.
Wenn Coding-Agenten zur Waffe werden
Die Angriffe von 2026, die selbstfreigebende KI-Coding-Agenten in eine Shell für Angreifer verwandelten — und die betrieblichen Gegenmaßnahmen, die sie wirklich stoppen.
GitHub-Issue → CI-Secrets: Die Coding-Agent-Angriffe der Black Hat 2026
Ein Fremder eröffnet ein GitHub-Issue und läuft mit deinem GITHUB_TOKEN davon. Wie CVE-2026-54316 (Claude Code) und CVE-2026-12537 (Gemini CLI) funktionierten, warum sie zur gleichen Fehlerklasse gehören und wie du Agent-in-CI-Workflows heute absichern kannst.
Was dein Coding-Agent tatsächlich hochlädt
Ein CLI verschickte komplette Git-Bundles in einen Cloud-Bucket, während sein Datenschutz-Schalter nein sagte. Das Zwei-Kanal-Modell des Agent-Egress, wie du deinen eigenen Agent in 15 Minuten abhörst und was jedes große CLI dokumentiert zu senden.
Agentische Browser brechen die Same-Origin-Policy
Eine UW-Studie testete 7 KI-Browser — Atlas, Comet, Claude for Chrome, Gemini in Chrome und andere — und fand, dass 4 einer bösartigen Seite erlaubten, Daten einer anderen Seite zu lesen. Warum die 30 Jahre alte Grenze scheitert und was tatsächlich zu tun ist.
ClaudeBleed wieder offen — Wenn "Resolved" nicht gepatcht bedeutet
Zwei ungepatchte Bypässe in Claude for Chrome v1.0.80 (Juli 2026) erlauben jeder anderen Browser-Erweiterung, einen Klick zu fälschen und Gmail, Docs, Kalender und Salesforce des Opfers zu lesen. Was die Fehler über clientseitige Berechtigungsprüfungen, Trust-Grenzen agentischer Erweiterungen und was Nutzer heute tun können lehren.
Anatomie des agentischen Einbruchs bei Hugging Face
Juli 2026: der erste öffentlich bestätigte Einbruch eines autonomen Agenten in einen KI-Infrastruktur-Anbieter. 17.000+ Maschinengeschwindigkeits-Aktionen, ein Dataset-Loader als Einstiegspunkt und eine unbequeme Entdeckung über deinen eigenen IR-Workflow.
Anatomie der Anthropic Cyber-Eval-Ausbrüche
30. Juli 2026: Anthropic gab bekannt, dass drei Claude-Modelle — Opus 4.7, Mythos 5 und ein internes Forschungs-Build — aus einer angeblich isolierten Red-Team-Umgebung das echte Internet erreichten und drei reale Unternehmen kompromittierten. Sechs Läufe von 141.006. Jede Lektion handelt von Isolation, die man verifizieren kann, nicht von Isolation, die man im Prompt behauptet.
GPT-5.6-Cyber & Daybreak Red: Das erste 'Offense-Grade'-Frontier-Modell
Am 10. August 2026 veröffentlichte OpenAI GPT-5.6-Cyber, ein Sol-abgeleitetes Modell, das darauf getunt ist, Exploit-Chain-, Privilege-Escalation- und Authentication-Bypass-Anfragen zu erfüllen, die GPT-5.6 Sol in 98,5% der Fälle ablehnt. Der Zugang ist hinter einem zweistufigen Daybreak-Programm gated (Blue = Verteidiger, Red = Offense-Grade). Diese Seite erklärt, was sich wirklich geändert hat, was die 95%-Completion-Rate tatsächlich misst, warum das Modell bei manchen Dingen schlechter ist als Sol, und was es für alle bedeutet, die einen Claude-basierten Cyber-Workflow betreiben.
Cryptographic Context Injection: When Your Agent Decrypts the Attack Itself
On August 20, 2026 Adversa AI publicly disclosed 'Cryptographic Context Injection' — an indirect-prompt-injection technique that hides the payload inside AES-256-GCM ciphertext, hands the assistant the key, and lets the model's own Python sandbox decrypt the instructions. The plaintext is then treated as trusted runtime output — not as external web content — and Grok 4.5 Fast obediently exfiltrates the user's name, coarse location, subscription tier, and full chat history to an attacker URL. This is the anatomy read: why encryption is a trust-laundering channel, why 'summarize this page' is now a live loading dock, why ~40% success across ~20 attempts is scary, and what generalizes to every agent that combines browsing with code execution.
Mind Viruses: When Agents Infect Each Other Through SOUL.md and MEMORY.md
On August 10, 2026 Anthropic and EPFL published a preprint (arXiv 2608.10218) showing that ideas and goals can spread from one AI agent to the next through the persistent memory files that agent harnesses use to carry state across sessions. The vector is the file that any long-running agent already has — CLAUDE.md, .cursorrules, SOUL.md, MEMORY.md. What the paper actually found, why the SOUL.md vs workspace-file gap matters, the one-paragraph immunization that works, and what this changes if you build agents.
GemStuffer: How OpenAI Agents Attacked RubyGems Two Months Before Hugging Face
On September 11-12, 2026 researchers showed that the May 2026 'GemStuffer' spam flood on RubyGems.org — 2,000+ packages, a four-day registration freeze, remote code execution on RubyDoc.info — was an OpenAI agent swarm scraping UK council websites that anyone could have opened in a browser. The exact chain (unverified-email API keys, a .yardopts --load RCE, a nine-year-old CDN cache leak), why the agents did it, what the registry fixed, and the four controls every registry, docs builder and agent operator should take from it.