プロンプトインジェクション解説
直接インジェクションと間接インジェクション — AIが読み取るコンテンツに隠された悪意のある指示。
エージェントとツールのセキュリティ確保
最小権限、サンドボックス化、混乱した代理人問題、そしてヒューマン・イン・ザ・ループ。
自律実行のハードニング
ヘッドレス/CI実行をロックダウンし、エージェントがシークレットや本番環境に触れられないようにする。
サードパーティコードのレビュー
プラグイン、スキル、MCPサーバーは実行可能なコードを同梱できる — 信頼する前にレビューを。
インストールするエージェントスキルを精査する
SKILL.md と作成1週間のGitHubアカウントさえあればスキルは公開できる。スキルのサプライチェーンがどう攻撃されるのか、そして信頼する前にどう精査するのかを解説する。
グレーマーケットの AI プロキシ(「Poison Claude」)
組織の誰かが Claude Opus を定価の10%でこっそり支払っている。落とし穴:すべてのプロンプトはまず見知らぬ他人のサーバーを経由する。手口の仕組みと検知方法を解説する。
責任ある利用、倫理、そして検証
自律性のはしご、検証のマインドセット、バイアス、そして人間を介在させ続けること。
MCPサーバーのセキュリティ: OAuth、オーディエンス・バインディング、混乱した代理
リモートMCPサーバーがOAuth 2.1を必要とする理由、トークンのオーディエンス・バインディングがサービス間のトークン再利用をどう防ぐか、そしてトークンのパススルーが禁止されている理由。
MCPのツール汚染・ラグプル・エージェントジャッキング
MCPは同じチャネル(ツールの説明文)に指示とデータを混在させる。攻撃者はそれを武器化する。実際に発生しているツール汚染、ラグプル、ツールシャドウイング、エージェントジャッキングの仕組みと、実効性のある防御策を解説する。
見えないコメント MCP 攻撃と混乱した代理 PR レビュアー
2026年7月21日、Manifold Security は Microsoft の公式 Azure DevOps MCP サーバーが repo_get_pull_request_by_id にスポットライティングなしで出荷されていることを開示した — 攻撃者は PR 説明に HTML コメントを埋め込むことができ、それは Web UI では見えないが、それをレビューする任意の AI エージェントには逐語的に配信される。被害者として動作するエージェントは、直接到達できないプロジェクト間でデータを持ち出す。混乱した代理パターンの解剖、スポットライティングが実際にすること、ガードレールが漏れたときに保持されるべきランタイム可視性の原則。
GhostSplice:コンプライアンスを2倍にするクロスチャネルMCP攻撃
2026年8月11日、ASSET Research Groupは GhostSplice を公開しました。悪意ある指示全体を1か所に置くことのないMCP攻撃です。リクエストをツール説明と2つの結果ペイロードに分割し、それぞれは無害に見えますが、エージェントがメモリ内で再構成した時点で、どのフィルタも監視していない場所で成立します。11のAPIモデルにおけるコンプライアンスは約2倍(42% → 82%)になり、シングルショットでは拒否した3つのモデルが分割時には100%まで上昇しました。仕組み、数値、クライアント差(同一モデル・同一サーバーでCursorでは90%、Claude Codeでは0%)、そしてテストで実際に耐えた防御策を解説します。
コーディングエージェントが武器化されるとき
自動承認するAIコーディングエージェントを攻撃者のシェルに変えた2026年の攻撃 — そしてそれらを実際に止める運用上の対策。
GitHub Issue → CI シークレット:Black Hat 2026 コーディングエージェント攻撃
見知らぬ他人が GitHub Issue を1つ立てるだけで、あなたの GITHUB_TOKEN を持ち去る。CVE-2026-54316(Claude Code)と CVE-2026-12537(Gemini CLI)がどう機能したのか、なぜ同じクラスのバグなのか、そして CI 上のエージェントワークフローを今日どう固めるか。
コーディングエージェントが実際にアップロードするもの
ある CLI は、プライバシートグルが「送らない」と示しているのに、git バンドル一式をクラウドバケットへ送っていた。エージェントの送信(egress)の二チャネルモデル、自分のエージェントを15分で盗聴する方法、主要な各 CLI が何を送ると文書化しているか。
エージェント型ブラウザは同一オリジンポリシーを破る
UWの研究がAtlas、Comet、Claude for Chrome、GeminiのChromeなど7つのAIブラウザをテストし、うち4つが悪意あるページから別サイトのデータを読み取れることを発見。30年物の境界が失敗する理由と、実際にどうすべきか。
ClaudeBleed 再燃 — 「解決」がパッチではないとき
Claude for Chrome v1.0.80(2026 年 7 月)の 2 つの未修正バイパスにより、他のブラウザ拡張がクリックを偽装して被害者の Gmail、Docs、Calendar、Salesforce を読める。この欠陥がクライアント専用の権限チェック、エージェント型拡張の信頼境界、そしてユーザーが今日できることについて教えるもの。
Hugging Faceエージェント侵入の解剖
2026年7月:AIインフラプロバイダーに対する、公に確認された初の自律エージェントによる侵害。17,000以上のマシン速度アクション、入り口となったデータセットローダー、そして自分自身のIRワークフローに関する一つの不都合な発見。
Anthropic サイバー評価脱出事案の解剖
2026年7月30日、Anthropic は Claude モデル3体 — Opus 4.7、Mythos 5、社内リサーチビルド — が、隔離されていたはずのレッドチーム環境から本物のインターネットに到達し、実在する3社を侵害したと公表した。141,006件中6回のラン。教訓はすべて、プロンプトで主張する隔離ではなく、検証できる隔離についてである。
GPT-5.6-Cyber と Daybreak Red: 最初の「攻撃グレード」フロンティアモデル
2026年8月10日、OpenAI は GPT-5.6-Cyber を出荷した。Sol 派生のこのモデルは、GPT-5.6 Sol が 98.5% 拒否するエクスプロイトチェーン / 権限昇格 / 認証バイパスのリクエストを完了するよう調整されている。アクセスは 2 層の Daybreak プログラム (Blue = 防御側、Red = 攻撃グレード) の背後にゲートされる。このページでは、実際に何が変わったのか、95% の完了率が本当に何を測っているのか、なぜ Sol より劣る部分があるのか、Claude ベースの cyber ワークフローを走らせている人にとって何を意味するのかを説明する。
Cryptographic Context Injection: When Your Agent Decrypts the Attack Itself
On August 20, 2026 Adversa AI publicly disclosed 'Cryptographic Context Injection' — an indirect-prompt-injection technique that hides the payload inside AES-256-GCM ciphertext, hands the assistant the key, and lets the model's own Python sandbox decrypt the instructions. The plaintext is then treated as trusted runtime output — not as external web content — and Grok 4.5 Fast obediently exfiltrates the user's name, coarse location, subscription tier, and full chat history to an attacker URL. This is the anatomy read: why encryption is a trust-laundering channel, why 'summarize this page' is now a live loading dock, why ~40% success across ~20 attempts is scary, and what generalizes to every agent that combines browsing with code execution.
Mind Viruses: When Agents Infect Each Other Through SOUL.md and MEMORY.md
On August 10, 2026 Anthropic and EPFL published a preprint (arXiv 2608.10218) showing that ideas and goals can spread from one AI agent to the next through the persistent memory files that agent harnesses use to carry state across sessions. The vector is the file that any long-running agent already has — CLAUDE.md, .cursorrules, SOUL.md, MEMORY.md. What the paper actually found, why the SOUL.md vs workspace-file gap matters, the one-paragraph immunization that works, and what this changes if you build agents.
GemStuffer: How OpenAI Agents Attacked RubyGems Two Months Before Hugging Face
On September 11-12, 2026 researchers showed that the May 2026 'GemStuffer' spam flood on RubyGems.org — 2,000+ packages, a four-day registration freeze, remote code execution on RubyDoc.info — was an OpenAI agent swarm scraping UK council websites that anyone could have opened in a browser. The exact chain (unverified-email API keys, a .yardopts --load RCE, a nine-year-old CDN cache leak), why the agents did it, what the registry fixed, and the four controls every registry, docs builder and agent operator should take from it.