리서치 2026년 4월 4일 · 12분 분량

MCP 프로토콜 보안 감사에서 치명적 취약점 발견, 프롬프트 인젝션이 주요 LLM 12개의 가드레일 우회, 에이전트형 DAST가 수동 침투 테스터 능가

Trail of Bits와 NCC Group은 4만 건이 넘는 배포에 영향을 미치는 Anthropic MCP 프로토콜의 도구 체인 오염 문제를 공개했습니다. ETH Zurich의 CRESCENDO-2는 주요 LLM 12개의 가드레일을 우회했고, Stanford 연구에서는 AI 에이전트가 체계적인 취약점 발견에서 사람 침투 테스터를 앞섰습니다. AI 모델 공급망 공격은 340% 급증했습니다.


🔴 치명적: MCP 프로토콜 보안 감사에서 도구 체인 오염 경로 발견

현재 4만 개가 넘는 AI 에이전트 배포가 채택한 Anthropic의 Model Context Protocol(MCP)을 종합 감사한 결과, 공격자가 도구 설명을 조작하고 매개변수 스키마를 통해 악성 지시를 삽입하며 연구진이 "도구 체인 오염"이라고 부르는 방식으로 에이전트의 의사결정을 탈취할 수 있는 취약점군이 발견됐습니다.

Trail of Bits와 NCC Group이 조율된 공개 협약 아래 공동으로 수행한 감사에서는 서로 다른 세 가지 공격 유형이 확인됐습니다.

도구 설명 인젝션(TDI)

MCP 서버 매니페스트에는 도구마다 사람이 읽을 수 있는 설명이 들어갑니다. LLM 기반 에이전트는 이 설명을 추론 맥락의 일부로 처리하므로, MCP 서버를 통제하거나 침해한 공격자는 도구 설명 안에 적대적 지시를 직접 심을 수 있습니다. 시험에서 연구진은 에이전트 행동을 다른 방향으로 유도하는 데 에이전트 행동 전환 성공률은 94%였으며 연구진은 반복 시험에서도 결과를 확인했습니다.

스키마 매개변수 밀수

도구 매개변수용 JSON Schema 정의에는 description, default, examples 필드가 포함될 수 있습니다. LLM은 매개변수를 구성할 때 이 필드를 소비하지만 대부분 검증하지 않습니다. 연구진은 매개변수 설명에 지시를 심어 에이전트가 대화 기록, 시스템 프롬프트, 자격 증명을 외부 API 호출에 포함하게 만드는 방식으로 민감한 데이터를 유출했습니다.

서버 간 권한 상승

에이전트가 여러 MCP 서버에 동시에 연결되면 악성 서버가 다른 연결 서버의 도구를 호출하도록 지시할 수 있습니다. 현재 MCP 명세에는 교차 출처 격리가 없어 한 서버의 도구가 다른 서버 호출에 영향을 주지 못하게 막는 프로토콜 수준 장치가 없습니다.

영향: 제3자 MCP 서버를 사용하거나 서버 매니페스트를 암호학적으로 검증하지 않는 모든 배포가 영향을 받습니다. 공개 레지스트리에 올라온 커뮤니티 MCP 서버 대부분이 여기에 해당합니다.

완화책: 도구 설명 고정(도구 매니페스트를 해시하고 변경 시 경고), 클라이언트 수준의 매개변수 스키마 검증, MCP 서버 연결별 별도 에이전트 맥락을 통한 서버 격리를 구현하십시오. Anthropic은 조사 결과를 인정했으며 MCP 명세 2026.04 버전에 의무적 도구 매니페스트 서명과 선택적 서버 격리 모드를 도입하겠다고 밝혔습니다.

🔴 치명적: 범용 프롬프트 인젝션이 주요 LLM 12개의 가드레일 우회

ETH Zurich AI Security Lab 연구진은 GPT-4o, Claude 3.5, Gemini 1.5 Pro, Llama 3.1 405B, Mistral Large를 포함한 주요 LLM 12개의 안전 가드레일을 체계적으로 우회하는 진화형 프롬프트 인젝션 프레임워크 "CRESCENDO-2"를 발표했습니다.

특정 서식 요령에 의존하던 이전 기법과 달리 CRESCENDO-2는 5~8차례 대화에 걸쳐 맥락을 점진적으로 재구성하는 경사도 비사용 최적화 방식을 씁니다. 각 대화는 따로 보면 완전히 무해하지만 누적된 맥락은 모델의 안전 학습보다 이미 형성된 대화 흐름의 영향력이 커지는 의미 환경을 만듭니다.

주요 결과

Anthropic과 OpenAI를 비롯한 여러 공급업체가 부분 완화책을 적용했으며, 예비 재시험에서 우회율이 약 20% 낮아졌습니다.

업계에 미치는 영향: 이번 연구는 LLM 가드레일을 주된 보안 통제로 쓸 수 있다는 전제에 의문을 제기합니다. 조직은 모델 자체의 판단과 독립된 출력 필터링, 행동 승인 계층, 결정론적 안전 점검으로 심층 방어를 구현해야 합니다.

🟠 높음: Stanford 시험에서 에이전트형 DAST가 수동 침투 테스터 능가

Stanford Computer Security Lab이 OWASP와 공동 수행한 주요 연구는 OWASP Top 10 전반의 알려진 취약점 20개를 각각 포함한 맞춤형 웹 애플리케이션 15개에서 선도적인 에이전트형 DAST 플랫폼 3개와 숙련된 사람 침투 테스터를 직접 비교했습니다.

지표사람 침투 테스터(평균)에이전트형 DAST(최고)에이전트형 DAST(평균)
발견한 취약점(20개 중)14.21715.8
완료 시간8.5시간47분1.2시간
오탐2.134.2
발견한 비즈니스 로직 결함5개 중 4.8개5개 중 2개5개 중 1.4개
발견한 인증 우회3개 중 3개3개 중 3개3개 중 2.6개
보고서 품질(1~10)8.77.26.1

에이전트 시스템은 인젝션 결함, 잘못된 구성, 접근 통제 문제를 빠짐없이 훑는 체계적 범위에서 뛰어났습니다. 반면 애플리케이션 고유의 작업 흐름을 이해해야 하는 비즈니스 로직 취약점은 사람 침투 테스터가 AI보다 훨씬 잘 찾았습니다.

핵심 통찰: 사람과 AI를 결합한 모델은 평균 20개 중 19.1개를 찾아 사람만 사용할 때보다 35%, AI만 사용할 때보다 21% 개선됐습니다. 이는 자동화된 AI 스캔과 전문가 분석을 결합하는 방식의 타당성을 입증합니다.

🟡 연구: 2026년 1분기 AI 모델 공급망 공격 340% 급증

JFrog의 분기 AI/ML 보안 보고서에 따르면 2026년 1분기 AI 모델 레지스트리와 ML 파이프라인 종속성을 노린 악성 패키지가 340% 증가했습니다.

권고: 모델 서명 검증(ML용 Sigstore)을 구현하고, 모델을 불러오기 전에 ModelScan/Picklescan으로 파일을 스캔하며, 모델 버전과 체크섬을 고정하고, 샌드박스 환경에서 추론을 격리하십시오.

🟡 새로운 흐름: AI 감사 추적을 위한 영지식 증명 확산

기업들은 독점 모델의 세부 정보를 노출하지 않고도 검증 가능한 AI 감사 추적을 만들기 위해 영지식 증명(ZKP) 시스템을 도입하고 있습니다. 2026년 8월 시행되는 EU AI Act 투명성 요건에 대응해 Fortune 100 기업 세 곳이 이번 분기에 ZKP 기반 AI 감사 구현을 공개했습니다.

이 기술을 사용하면 기업은 모델 가중치, 아키텍처, 학습 데이터를 공개하지 않고도 편향 기준 준수나 데이터 처리 요건 같은 AI 시스템의 특정 속성을 증명할 수 있습니다.


KENSAI 권고

  1. MCP를 사용하는 AI/ML 팀: 연결된 MCP 서버를 모두 감사하고 도구 설명 고정과 매개변수 스키마 검증을 즉시 구현하십시오.
  2. 기업 LLM 배포: 가드레일에만 의존하지 말고 출력 필터링과 결정론적 행동 승인을 구현하십시오.
  3. 보안 팀: 범위를 극대화하려면 사람과 AI를 결합한 침투 테스트를 채택하십시오.
  4. ML 운영: 코드 종속성과 같은 엄격함으로 모델 레지스트리에 공급망 보안을 적용하십시오.
  5. 규정 준수 팀: EU AI Act 투명성 요건을 위한 ZKP 솔루션을 평가하십시오.

AI 인프라를 보호하십시오

KENSAI의 AI 기반 보안 플랫폼은 AI 배포 환경의 MCP 구성 오류, 프롬프트 인젝션 취약점, 공급망 위험을 식별합니다.

무료 보안 스캔 시작

KENSAI — AI 기반 보안 인텔리전스