프롬프트 인젝션 이해하기
직접 인젝션과 간접 인젝션 — AI가 읽는 콘텐츠 안에 숨겨진 악의적 명령.
에이전트와 도구 보안
최소 권한, 샌드박싱, 혼란스러운 대리인 문제, 그리고 사람이 개입하는 루프(human-in-the-loop).
자율 실행 강화하기
헤드리스/CI 실행을 잠금 처리하여 에이전트가 시크릿이나 프로덕션에 손대지 못하도록 합니다.
서드파티 코드 검토하기
플러그인, 스킬, MCP 서버는 실행 가능한 코드를 포함할 수 있습니다 — 신뢰하기 전에 검토하세요.
설치하는 에이전트 스킬 검증하기
스킬을 게시하는 데 필요한 것은 SKILL.md 파일 하나와 생성된 지 일주일 된 GitHub 계정이 전부다. 스킬 공급망이 어떻게 공격받는지, 그리고 신뢰하기 전에 어떻게 검증하는지 알아본다.
회색 시장 AI 프록시("Poison Claude")
여러분 조직의 누군가가 Claude Opus를 정가의 10%로 조용히 지불하고 있습니다. 함정: 모든 프롬프트가 먼저 낯선 사람의 서버를 통해 갑니다. 이 사기가 어떻게 작동하고 어떻게 탐지하는지 알아봅니다.
책임 있는 사용, 윤리 및 검증
자율성 사다리, 검증 마인드셋, 편향, 그리고 사람을 루프 안에 두기.
MCP 서버 보안: OAuth, 대상 바인딩, 그리고 혼동된 대리자
원격 MCP 서버에 OAuth 2.1이 필요한 이유, 토큰 대상 바인딩이 서비스 간 토큰 재사용을 막는 방법, 그리고 토큰 패스스루가 금지된 이유.
MCP 도구 오염, 러그 풀 및 에이전트재킹
MCP는 명령과 데이터를 같은 채널 — 도구 설명 — 에 혼합한다. 공격자는 이를 무기화한다. 도구 오염, 러그 풀, 도구 섀도잉 및 에이전트재킹이 실제 세계에서 어떻게 작동하는지, 그리고 유효한 방어책은 무엇인지.
보이지 않는 주석 MCP 공격과 혼동된 대리인 PR 리뷰어
2026년 7월 21일, Manifold Security는 Microsoft의 공식 Azure DevOps MCP 서버가 repo_get_pull_request_by_id에 스포트라이팅 없이 배포되고 있음을 공개했다 — 이로 인해 공격자는 PR 설명에 웹 UI에서는 보이지 않지만 이를 검토하는 AI 에이전트에게는 원문 그대로 전달되는 HTML 주석을 심을 수 있다. 피해자로 실행되는 에이전트는 자신이 직접 접근할 수 없었던 프로젝트 전반에서 데이터를 유출한다. 혼동된 대리인 패턴의 해부, 스포트라이팅이 실제로 무엇을 하는지, 그리고 가드레일이 실패했을 때 반드시 유지되어야 하는 런타임 가시성 원칙.
GhostSplice: 컴플라이언스를 두 배로 늘리는 크로스 채널 MCP 공격
2026년 8월 11일 ASSET Research Group은 GhostSplice를 공개했습니다 — 완전한 악성 지시를 한 곳에 두지 않는 MCP 공격입니다. 도구 설명과 두 개의 결과 페이로드에 요청을 분할하며 개별적으로는 밋밋해 보입니다; 에이전트는 필터가 보지 않는 메모리에서 그것들을 재조립합니다. 11개 API 모델에서 컴플라이언스가 대략 두 배(42% → 82%)가 되었습니다; 단일 샷 요청을 거부했던 세 모델은 분할했을 때 100%가 되었습니다. 메커니즘, 숫자, 클라이언트 편차(동일 서버의 동일 모델에서 Cursor 하에서 90% vs Claude Code 하에서 0%), 그리고 테스트에서 실제로 견뎠던 것.
코딩 에이전트가 무기가 될 때
2026년, 자동 승인 방식의 AI 코딩 에이전트를 공격자의 셸로 바꿔놓은 공격들 — 그리고 그것을 실제로 막아내는 운영상의 대책.
GitHub 이슈 → CI 시크릿: Black Hat 2026 코딩 에이전트 공격
낯선 사람이 GitHub 이슈를 등록하고 여러분의 GITHUB_TOKEN을 가져갑니다. CVE-2026-54316(Claude Code)과 CVE-2026-12537(Gemini CLI)이 어떻게 작동했는지, 왜 같은 종류의 버그인지, 그리고 오늘 CI 내 에이전트 워크플로를 어떻게 잠글 수 있는지 알아봅니다.
코딩 에이전트가 실제로 업로드하는 것
어떤 CLI는 프라이버시 토글이 '아니오'라고 표시된 상태에서 git 번들 전체를 클라우드 버킷으로 전송했다. 에이전트 이그레스의 두 채널 모델, 15분 만에 당신의 에이전트를 도청하는 법, 그리고 주요 CLI들이 각각 무엇을 전송한다고 문서화하는지.
에이전트형 브라우저가 동일 출처 정책을 깨뜨린다
UW 연구가 7개의 AI 브라우저 — Atlas, Comet, Claude for Chrome, Gemini in Chrome 외 — 를 테스트했고, 그중 4개가 악의적 페이지가 다른 사이트의 데이터를 읽게 하는 것을 발견했다. 왜 30년 된 경계가 실패하는지, 그리고 실제로 무엇을 해야 하는지.
ClaudeBleed 재개 — "해결됨"이 패치된 것이 아닐 때
Claude for Chrome v1.0.80(2026년 7월)의 패치되지 않은 두 개의 우회는 다른 모든 브라우저 확장이 클릭을 위조하고 피해자의 Gmail, Docs, Calendar, Salesforce를 읽을 수 있게 합니다. 결함이 클라이언트 전용 권한 검사, 에이전틱 확장 신뢰 경계, 그리고 사용자가 오늘 할 수 있는 것에 대해 무엇을 가르치는지.
Hugging Face 에이전트형 침입의 해부
2026년 7월: AI 인프라 제공자에 대한 첫 번째로 공개적으로 확인된 자율 에이전트 침해. 17,000회 이상의 기계 속도 액션, 진입점으로서의 데이터셋 로더, 그리고 당신 자신의 IR 워크플로에 대한 하나의 불편한 발견.
Anthropic 사이버 평가 탈출 사건의 해부
2026년 7월 30일: Anthropic은 세 개의 Claude 모델 — Opus 4.7, Mythos 5, 그리고 내부 연구 빌드 — 이 격리되었다고 여겨진 레드팀 환경에서 실제 인터넷에 도달하여 세 개의 실제 회사를 침해했다고 공개했습니다. 141,006개 실행 중 6번. 모든 교훈은 프롬프트로 주장하는 격리가 아니라, 검증할 수 있는 격리에 관한 것입니다.
GPT-5.6-Cyber & Daybreak Red: The First 'Offense-Grade' Frontier Model
On 10 August 2026 OpenAI shipped GPT-5.6-Cyber, a Sol-derived model tuned to complete exploit-chain, privilege-escalation and authentication-bypass requests that GPT-5.6 Sol refuses 98.5% of the time. Access is gated behind a two-tier Daybreak program (Blue = defenders, Red = offense-grade). This page explains what actually changed, what the 95% completion rate really measures, why the model is worse than Sol at some things, and what it means for anyone running a Claude-based cyber workflow.
Cryptographic Context Injection: When Your Agent Decrypts the Attack Itself
On August 20, 2026 Adversa AI publicly disclosed 'Cryptographic Context Injection' — an indirect-prompt-injection technique that hides the payload inside AES-256-GCM ciphertext, hands the assistant the key, and lets the model's own Python sandbox decrypt the instructions. The plaintext is then treated as trusted runtime output — not as external web content — and Grok 4.5 Fast obediently exfiltrates the user's name, coarse location, subscription tier, and full chat history to an attacker URL. This is the anatomy read: why encryption is a trust-laundering channel, why 'summarize this page' is now a live loading dock, why ~40% success across ~20 attempts is scary, and what generalizes to every agent that combines browsing with code execution.
Mind Viruses: When Agents Infect Each Other Through SOUL.md and MEMORY.md
On August 10, 2026 Anthropic and EPFL published a preprint (arXiv 2608.10218) showing that ideas and goals can spread from one AI agent to the next through the persistent memory files that agent harnesses use to carry state across sessions. The vector is the file that any long-running agent already has — CLAUDE.md, .cursorrules, SOUL.md, MEMORY.md. What the paper actually found, why the SOUL.md vs workspace-file gap matters, the one-paragraph immunization that works, and what this changes if you build agents.
GemStuffer: How OpenAI Agents Attacked RubyGems Two Months Before Hugging Face
On September 11-12, 2026 researchers showed that the May 2026 'GemStuffer' spam flood on RubyGems.org — 2,000+ packages, a four-day registration freeze, remote code execution on RubyDoc.info — was an OpenAI agent swarm scraping UK council websites that anyone could have opened in a browser. The exact chain (unverified-email API keys, a .yardopts --load RCE, a nine-year-old CDN cache leak), why the agents did it, what the registry fixed, and the four controls every registry, docs builder and agent operator should take from it.