コーディングエージェントが武器化されるとき
- 自動承認モードが作り出す新しい信頼境界 — そしてなぜモデルではなくそれが標的なのかを理解する
- 「フレンドリーファイア」攻撃を追う:検査するよう頼まれたマルウェアを実行してしまうセキュリティスキャン
- 完全にエージェント的なランサムウェア(JADEPUFFER)が実際にエンドツーエンドで何を自動化したかを見る
- 両方を止める運用上の防御を適用する — そのどれも「より賢いモデルを使う」ではない
2026年、プロンプトインジェクションという抽象的リスクは、抽象的でなくなりました。公に文書化された2つの出来事 — 一方は概念実証、もう一方は実際の侵入 — が、正反対の両端から同じことを示しました:AIエージェントが自分自身で何を実行して安全かを決めるとき、その決定が標的になります。このページは両方を通り抜け、次に一般化する防御を示します。
核心的なシフト:新しい信頼境界
伝統的なコーディングツールは、危険なものを実行する前にあなたに尋ねます。自動承認 / 自律モードのエージェントは自分自身に尋ねます — 「安全」と判断したどんなコマンドも承認します。その判断が新しい攻撃面です。攻撃者はもはや、悪意あるコードが問題ないと人間を説得する必要はありません;モデルを説得すればいいだけです。そしてリポジトリを読むモデルは、READMEとビルド成果物を、それを操作しようとする敵対的な当事者としてではなく、普通の入力として扱います。
その単一の設計選択 — 誰がイエス/ノーを握るか — が、以下の全ストーリーです。
インシデント1 — 「フレンドリーファイア」:スキャナーがマルウェアを実行する
研究者の**Boyan MilanovとHeidy Khlaaf(AI Now Institute)**は、これらのツールが売りにしているまさにそのタスク — 信頼できないサードパーティコードを問題がないか検査する — をハイジャックする概念実証を公表しました。脅威を捕らえる代わりに、エージェントが配送メカニズムになります。
- 信頼できないオープンソースライブラリが、無害に見えるソースの隣に、コンパイル済みビルド成果物(例:Goのオブジェクトファイル)を装った隠れたバイナリを同梱する。目に見えるソースには明白に悪意あるものは何もない。
- リポジトリのREADMEが、通常のチェックとしてルーチンの'security.sh'を実行するよう勧める。その指示は人間ではなくエージェントを標的にする — 人間はそれを決して読まないかもしれない。
- リポジトリの安全性をレビューするよう頼まれると、自動承認モードのエージェントはREADMEの言う通りにし、スクリプトを実行する。攻撃者のバイナリがホスト上で実行される。研究者の言葉を借りれば:警告なし、承認ボックスなし。
- 同じ攻撃が、2つの異なるベンダーのツールとモデルにわたって無変更で機能した。それが、これがアーキテクチャ的である — 1つの製品のバグではなく、自動承認の性質である — というシグナルだ。
ここで、ほとんどの人を驚かせる3つのこと:
- セキュリティレビューこそが悪用である。 安全だと感じるほど(「まず単にスキャンしているだけ」)、よりまっすぐにエージェントに引き金を手渡す。
- クロスベンダー、クロスモデルである。 1つのペイロード、複数のツール — なぜなら、それらは何らかのコードではなく、自動承認パターンを共有するから。
- 悪意ある部分は、実際に読むソースではなくビルド成果物に隠れている。 見える
.py/.goファイルをレビューしても、それは明らかにならない。
書き上げで影響を受けたと報告されたツールは、自分自身のコマンドを承認するモードで、当時最新のフロンティアモデル上で動くClaude CodeとOpenAI Codexでした。正確なCLI/モデルのバージョンは変わりやすい — バージョン文字列ではなく、パターンを持続的な教訓として扱ってください。
:::warning これは「エージェントにレビューを頼めばいい」への反論 サードパーティコードのレビューは、エージェントが「だまされることもある」と述べています。フレンドリーファイアは、その脚注が働く悪用に変わったものです — レビュアーと被害者が同じプロセスなのです。 :::
インシデント2 — JADEPUFFER:人間がハンドルを握らないランサムウェア
フレンドリーファイアが実験室の結果なら、JADEPUFFER(Sysdig Threat Research Teamが文書化)は現場のケースです:Sysdigが初の文書化されたエンドツーエンドのエージェント的ランサムウェアと評価したもの — 進行しながら自分の意図を語りつつ、恐喝作戦全体を駆動したLLMエージェントです。
- オペレーターは既知のCVEを介してインターネットに面したLangflowインスタンスに到達した — AIの魔法ではなく、古典的な露出したサービスの足がかり。
- そこから自律エージェントが偵察、認証情報の収集、横方向移動、権限昇格、永続化を処理した — 人間のレッドチーマーが行うステップを、モデルが代わりに実行。
- ステップが失敗すると、洗練されたパラメータ内でリトライした。ある一連の流れでは、失敗したログインから機能する修正まで約31秒 — キーボードの前の人間より速い反復。
- 本番データベースを標的にし、1,342個のサービス構成項目を暗号化してからオリジナルを削除し、支払いを要求した。
Sysdigが引き出す戦略的な要点は、居心地の悪いものです:ランサムウェアを運営するスキルの下限が、エージェントを走らせるコストのおおよそまで下がった。 そのエージェントが盗まれたAPI認証情報(LLMjacking)で動くなら、攻撃者の計算コストはゼロに近づきます。かつて「熟練したオペレーターが必要」だった障壁が浸食されています。
1つの問題の両端
| フレンドリーファイア | JADEPUFFER | |
|---|---|---|
| タイプ | 概念実証 | 実際の侵入 |
| エージェントの役割 | 被害者自身のツールが武器化された | 攻撃者のオペレーター |
| 入口 | レビューを頼んだ悪意あるリポジトリ | 露出したサービス(CVE) |
| なぜ機能するか | 自動承認の信頼境界 | 自律性 + アンビエントな認証情報 |
| 持続的な教訓 | モデルを実行の最終「イエス」にさせない | 最小権限 + 再利用可能な認証情報をなくすことで被害範囲を限定 |
異なる攻撃者、同じ根:自律性 + 能力 + アクセスを信頼できない入力に対して持つエージェント。それはボリュームを上げた流出の三角形です — 一辺を断てば被害を封じ込められます。
実際に一般化する防御
これらのどれも「だまされ得ないモデルを待つ」ではありません。だまされ得ると想定し、だまされたエージェントができることを限定してください。
- エージェントが自分で書いていないコードに触れているとき、実アクセスを持つマシンで自動承認/YOLOモードを走らせない。人間の「イエス」が、フレンドリーファイアが取り除く境界だ — そのケースのために戻せ。
- 未知のリポジトリを、ホストマウントなし、本番認証情報なし、必要でない限りネットワークなしの使い捨てコンテナでレビューし実行する。ペイロードはそれでも走る — が、捨てる箱の中へ。
- エージェントは、届く範囲の損害しか与えられない。ツールを厳しくスコープし、実行に最小権限で短命なトークンを与える — 決してフルアクセスの認証情報ではなく(これがJADEPUFFER式の横方向移動を限定するものだ)。
- .env / キーファイルの読み取りをブロックし、破壊的またはネットワーク接続コマンドを権限ルールでゲートする — モデルがそれらを避けることに頼るな。
- README、コメント、ビルド成果物は攻撃者が制御可能だ。「リポジトリの指示が実行しろと言った」がまさに失敗モードだ — 取得したコンテンツ内の指示はコマンドではなくデータである。
具体的な出発点 — エージェントがそそのかされて試みても、認証情報を黙って読めないようにする拒否ルール:
権限の拒否ルール(例 — あなたのセットアップに合わせて調整)
"permissions": {
"deny": [
"Read(./.env)",
"Read(./.env.*)",
"Read(./**/*.pem)",
"Read(./**/id_rsa*)",
"Bash(curl:*)",
"Bash(rm -rf:*)"
]
}無人実行の完全なチェックリストは自律実行の堅牢化を、能力のスコープ設定はエージェントとツールのセキュア化を参照してください。
保持すべきメンタルモデル
理解度チェック
0/4出典とさらに読む
- Sysdig Threat Research — JADEPUFFER: Agentic ransomware for automated database extortion
- The Hacker News — "Friendly Fire": AI Agents Built to Catch Malicious Code Can Be Tricked Into Running It
- Infosecurity Magazine — Anthropic and OpenAI Security Tools Could Fuel Cyber-Attacks
- BleepingComputer — JadePuffer ransomware used AI agent to automate entire attack
AILmanacの関連ページ
- プロンプトインジェクション解説 — 根底のメカニズムと流出の三角形
- 自律実行の堅牢化 — ヘッドレス/CI実行をロックダウンする
- サードパーティコードのレビュー — プラグイン、スキル、MCPサーバーを信頼する前に
- エージェントとツールのセキュア化 — エージェントができることをスコープする