メインコンテンツまでスキップ

コーディングエージェントが武器化されるとき

上級
What you'll learn
  • 自動承認モードが作り出す新しい信頼境界 — そしてなぜモデルではなくそれが標的なのかを理解する
  • 「フレンドリーファイア」攻撃を追う:検査するよう頼まれたマルウェアを実行してしまうセキュリティスキャン
  • 完全にエージェント的なランサムウェア(JADEPUFFER)が実際にエンドツーエンドで何を自動化したかを見る
  • 両方を止める運用上の防御を適用する — そのどれも「より賢いモデルを使う」ではない

2026年、プロンプトインジェクションという抽象的リスクは、抽象的でなくなりました。公に文書化された2つの出来事 — 一方は概念実証、もう一方は実際の侵入 — が、正反対の両端から同じことを示しました:AIエージェントが自分自身で何を実行して安全かを決めるとき、その決定が標的になります。このページは両方を通り抜け、次に一般化する防御を示します。

核心的なシフト:新しい信頼境界

伝統的なコーディングツールは、危険なものを実行する前にあなたに尋ねます。自動承認 / 自律モードのエージェントは自分自身に尋ねます — 「安全」と判断したどんなコマンドも承認します。その判断が新しい攻撃面です。攻撃者はもはや、悪意あるコードが問題ないと人間を説得する必要はありません;モデルを説得すればいいだけです。そしてリポジトリを読むモデルは、READMEとビルド成果物を、それを操作しようとする敵対的な当事者としてではなく、普通の入力として扱います。

その単一の設計選択 — 誰がイエス/ノーを握るか — が、以下の全ストーリーです。

インシデント1 — 「フレンドリーファイア」:スキャナーがマルウェアを実行する

研究者の**Boyan MilanovとHeidy Khlaaf(AI Now Institute)**は、これらのツールが売りにしているまさにそのタスク — 信頼できないサードパーティコードを問題がないか検査する — をハイジャックする概念実証を公表しました。脅威を捕らえる代わりに、エージェントが配送メカニズムになります。

Guided walkthrough1 of 4
  1. 信頼できないオープンソースライブラリが、無害に見えるソースの隣に、コンパイル済みビルド成果物(例:Goのオブジェクトファイル)を装った隠れたバイナリを同梱する。目に見えるソースには明白に悪意あるものは何もない。

ここで、ほとんどの人を驚かせる3つのこと:

  • セキュリティレビューこそが悪用である。 安全だと感じるほど(「まず単にスキャンしているだけ」)、よりまっすぐにエージェントに引き金を手渡す。
  • クロスベンダー、クロスモデルである。 1つのペイロード、複数のツール — なぜなら、それらは何らかのコードではなく、自動承認パターンを共有するから。
  • 悪意ある部分は、実際に読むソースではなくビルド成果物に隠れている。 見える.py/.goファイルをレビューしても、それは明らかにならない。

書き上げで影響を受けたと報告されたツールは、自分自身のコマンドを承認するモードで、当時最新のフロンティアモデル上で動くClaude CodeとOpenAI Codexでした。正確なCLI/モデルのバージョンは変わりやすい — バージョン文字列ではなく、パターンを持続的な教訓として扱ってください。

:::warning これは「エージェントにレビューを頼めばいい」への反論 サードパーティコードのレビューは、エージェントが「だまされることもある」と述べています。フレンドリーファイアは、その脚注が働く悪用に変わったものです — レビュアーと被害者が同じプロセスなのです。 :::

インシデント2 — JADEPUFFER:人間がハンドルを握らないランサムウェア

フレンドリーファイアが実験室の結果なら、JADEPUFFER(Sysdig Threat Research Teamが文書化)は現場のケースです:Sysdigが初の文書化されたエンドツーエンドのエージェント的ランサムウェアと評価したもの — 進行しながら自分の意図を語りつつ、恐喝作戦全体を駆動したLLMエージェントです。

Guided walkthrough1 of 4
  1. オペレーターは既知のCVEを介してインターネットに面したLangflowインスタンスに到達した — AIの魔法ではなく、古典的な露出したサービスの足がかり。

Sysdigが引き出す戦略的な要点は、居心地の悪いものです:ランサムウェアを運営するスキルの下限が、エージェントを走らせるコストのおおよそまで下がった。 そのエージェントが盗まれたAPI認証情報(LLMjacking)で動くなら、攻撃者の計算コストはゼロに近づきます。かつて「熟練したオペレーターが必要」だった障壁が浸食されています。

1つの問題の両端

フレンドリーファイアJADEPUFFER
タイプ概念実証実際の侵入
エージェントの役割被害者自身のツールが武器化された攻撃者のオペレーター
入口レビューを頼んだ悪意あるリポジトリ露出したサービス(CVE)
なぜ機能するか自動承認の信頼境界自律性 + アンビエントな認証情報
持続的な教訓モデルを実行の最終「イエス」にさせない最小権限 + 再利用可能な認証情報をなくすことで被害範囲を限定

異なる攻撃者、同じ根:自律性 + 能力 + アクセスを信頼できない入力に対して持つエージェント。それはボリュームを上げた流出の三角形です — 一辺を断てば被害を封じ込められます。

実際に一般化する防御

これらのどれも「だまされ得ないモデルを待つ」ではありません。だまされ得ると想定し、だまされたエージェントができることを限定してください。

Guided walkthrough1 of 5
  1. エージェントが自分で書いていないコードに触れているとき、実アクセスを持つマシンで自動承認/YOLOモードを走らせない。人間の「イエス」が、フレンドリーファイアが取り除く境界だ — そのケースのために戻せ。

具体的な出発点 — エージェントがそそのかされて試みても、認証情報を黙って読めないようにする拒否ルール:

権限の拒否ルール(例 — あなたのセットアップに合わせて調整)

"permissions": {
"deny": [
  "Read(./.env)",
  "Read(./.env.*)",
  "Read(./**/*.pem)",
  "Read(./**/id_rsa*)",
  "Bash(curl:*)",
  "Bash(rm -rf:*)"
]
}

無人実行の完全なチェックリストは自律実行の堅牢化を、能力のスコープ設定はエージェントとツールのセキュア化を参照してください。

保持すべきメンタルモデル

素早い想起
Enter キーまたはスペースキーでカードを裏返します。左右の矢印キーでカードを移動できます。用語を表示しました。
1 / 5

理解度チェック

0/4
  1. フレンドリーファイア攻撃で、悪意あるペイロードを実行するようエージェントを説得するのは何ですか?
  2. 同じ攻撃が2つのベンダーのツールで無変更で機能したことが重要なのはなぜですか?
  3. JADEPUFFER式の自律的侵入の被害範囲を最も減らすのは何ですか?
  4. 見慣れないオープンソースリポジトリをエージェントにレビューさせようとしています。最も安全な一手は?

出典とさらに読む

AILmanacの関連ページ