브라우저 사용에서 프롬프트 인젝션 위험 완화하기

Anthropic은 브라우저 기반 에이전트의 핵심 보안 위협인 프롬프트 인젝션에 대해, Claude Opus 4.5의 강건성 향상과 강화학습, 분류기, 인간 레드팀을 결합한 방어 개선 내용을 소개한다.

2025년 11월 24일영문 원문 보기 ↗
브라우저 사용에서 프롬프트 인젝션 위험 완화하기

Claude Opus 4.5는 프롬프트 인젝션(prompt injection), 곧 AI 모델이 처리하는 콘텐츠 안에 숨겨진 적대적 지시문에 대한 강건성에서 새로운 기준을 제시한다. 새 모델은 핵심 성능 자체와 이를 둘러싼 보호장치 모두에서 이전 버전보다 크게 향상됐다. 그러나 프롬프트 인젝션은, 특히 모델이 현실 세계의 행동을 더 많이 수행할수록, 아직 해결된 문제가 아니다.

Anthropic은 앞으로도 이런 진전을 이어가며, AI 모델, 또는 "에이전트(agent)"가 큰 가치가 걸린 과업을 유의미한 프롬프트 인젝션 위험 없이 처리할 수 있는 미래를 목표로 한다.

프롬프트 인젝션이란 무엇인가?

AI 에이전트가 진정으로 유용해지려면 사용자를 대신해 행동할 수 있어야 한다. 웹을 탐색하고, 과업을 수행하고, 사용자의 맥락과 데이터로 작업할 수 있어야 한다. 그러나 이 점이 곧 위험이기도 하다. 에이전트가 방문하는 모든 웹페이지는 잠재적 공격 벡터가 될 수 있다.

즉, 에이전트가 인터넷을 탐색할 때는 완전히 신뢰할 수 없는 콘텐츠와 마주한다. 정상적인 검색 결과, 문서, 애플리케이션 사이사이에 공격자가 에이전트를 탈취하고 행동을 바꾸기 위한 악성 지시문을 숨겨둘 수 있다. 이런 프롬프트 인젝션 공격은 브라우저 기반 AI 에이전트가 직면한 가장 중대한 보안 과제 가운데 하나다.

아래에서는 프롬프트 인젝션이 브라우저 에이전트를 어떻게 위협하는지, 그리고 이에 대응해 Anthropic이 Claude의 강건성을 어떻게 개선했는지를 설명한다.

이런 개선은 Claude for Chrome 확장을 연구 프리뷰에서 베타로 넓히기로 한 결정에도 반영됐다. 이제 이 확장은 Max 요금제의 모든 사용자에게 제공된다.

브라우저 사용이 특별한 프롬프트 인젝션 위험을 만드는 이유

프롬프트 인젝션의 위협을 이해하기 위해, Claude에게 최근 이메일을 읽고 회의 요청에 대한 답장을 초안으로 작성해 달라고 부탁하는 일상적 과제를 떠올려보자. 그 이메일 가운데 하나가 겉보기에는 공급업체 문의처럼 보이지만, 실제로는 흰색 텍스트에 숨겨진 지시문을 담고 있다고 하자. 사용자에게는 보이지 않지만 에이전트는 읽는 그 지시문이, Claude에게 사용자가 요청한 답장을 쓰기 전에 "confidential"이라는 단어가 포함된 이메일을 외부 주소로 전달하라고 명령할 수 있다.

이 공격이 성공하면, 사용자는 답장을 기다리는 사이 민감한 통신 내용을 외부로 유출당하게 된다.

신뢰할 수 없는 콘텐츠를 처리하는 모든 에이전트는 프롬프트 인젝션 위험에 노출되지만, 브라우저 사용은 두 가지 점에서 이를 증폭시킨다. 첫째, 공격 표면이 매우 넓다. 모든 웹페이지, 내장 문서, 광고, 동적으로 로드되는 스크립트가 악성 지시문의 잠재적 경로가 된다. 둘째, 브라우저 에이전트는 URL 이동, 양식 입력, 버튼 클릭, 파일 다운로드처럼 다양한 행동을 수행할 수 있으며, 공격자가 에이전트의 행동에 영향력을 확보하면 그 행동들을 악용할 수 있다.

브라우저 사용 강건성에 관한 Claude의 진전

Anthropic은 Claude for Chrome을 연구 프리뷰로 출시한 이후 프롬프트 인젝션 강건성에서 상당한 진전을 이뤘다. 아래 차트는 오늘 출시하는 Claude 브라우저 확장의 구성을, 최초 출시 시점의 구성과 비교한 것이다. 평가는 내부 적응형 Best-of-N 공격자를 사용해 수행했으며, 이 공격자는 효과적이라고 알려진 다양한 프롬프트 인젝션 기법을 여러 방식으로 시도하고 조합한다.

그림 1: 내부 Best-of-N 공격자에 대한 공격 성공률(ASR)

그림 1: Anthropic의 내부 Best-of-N 공격자에 대한 공격 성공률(ASR). 낮을수록 좋다. 적응형 공격자에게는 각 환경당 100회의 시도가 주어지며, ASR은 각 모델이 마주친 공격 가운데 성공한 비율로 계산된다.

Claude Opus 4.5는 브라우저 사용 환경에서 이전 모델들보다 더 강한 프롬프트 인젝션 강건성을 보여 준다. 또한 브라우저 확장의 최초 연구 프리뷰 이후 Anthropic은 모든 Claude 모델에서 안전성을 실질적으로 높이는 새 보호장치도 구현했다.

공격 성공률 1%는 분명 큰 진전이지만, 여전히 의미 있는 위험을 뜻한다. 어떤 브라우저 에이전트도 프롬프트 인젝션에 면역이 있는 것은 아니며, Anthropic은 이 결과를 문제가 해결됐다고 주장하기 위해서가 아니라, 진전이 있었음을 보여주기 위해 공개한다.

Anthropic의 작업은 다음 세 축에 집중됐다.

  • 프롬프트 인젝션 저항성 학습: 강화학습을 통해 프롬프트 인젝션 강건성을 Claude의 역량 안에 직접 구축한다. 모델 훈련 중에는 시뮬레이션된 웹 콘텐츠 안에 프롬프트 인젝션을 심어 두고, Claude가 그런 지시를 올바르게 식별해 따르지 않을 때 보상한다. 지시문이 권위 있거나 긴급해 보이도록 설계돼 있어도 마찬가지다.
  • 분류기 개선: 모델의 컨텍스트 윈도에 들어오는 모든 신뢰할 수 없는 콘텐츠를 스캔하고, 잠재적 프롬프트 인젝션을 분류기(classifier)로 표시한다. 이 분류기는 숨겨진 텍스트, 조작된 이미지, 기만적 UI 요소 같은 다양한 형태의 적대적 명령을 탐지하고, 공격을 식별하면 Claude의 동작을 조정한다. Anthropic은 최초 연구 프리뷰 이후 Claude for Chrome과 함께 쓰는 분류기와, 공격 시도가 탐지된 뒤 모델의 행동을 유도하는 개입 방식 모두를 개선했다.
  • 확장된 전문가 인간 레드팀: 인간 보안 연구자는 창의적인 공격 벡터를 찾는 데서 자동화 시스템보다 일관되게 더 뛰어나다. Anthropic의 내부 레드팀은 브라우저 에이전트의 취약점을 지속적으로 탐색하며, 업계 전반의 강건성을 비교하는 외부 Arena-style challenges에도 참여하고 있다.

앞으로의 방향

웹은 적대적인 환경이며, 그 안에서 안전하게 작동하는 브라우저 에이전트를 만들려면 지속적인 경계가 필요하다. 프롬프트 인젝션은 여전히 활발히 연구되는 분야이며, Anthropic은 공격 기법이 진화하는 데 맞춰 방어에도 계속 투자하겠다고 밝힌다.

Anthropic은 앞으로도 이런 진전을 투명하게 공개할 예정이다. 고객이 배포 판단을 더 잘 내릴 수 있도록 돕는 동시에, 이 중대한 과제에 대한 더 폭넓은 업계 투자를 촉진하기 위해서다.

모델과 제품을 프롬프트 인젝션에 더 강건하게 만드는 일에 관심이 있다면, Anthropic 팀 합류를 고려해 볼 수 있다.