Anthropic, 브라우저 AI의 중대 취약점 극복할 것으로 보임
Anthropic의 Claude Opus 5를 Auto Mode와 결합한 환경에서 브라우저 상의 AI 에이전트를 노린 프롬프트 주입 공격의 성공률이 129개의 테스트 시나리오에서 0퍼센트가 되었다고 보도되었다. 보호 메커니즘 없이의 성공률은 3.7퍼센트로, 추가 방어층이 큰 효과를 보여주고 있다. 다만 이 수치는 테스트 환경에 기반한 것이며, 실제 운영 환경에서의 유효성은 계속해서 검증이 필요한 단계이다.

Anthropic의 모델인 Claude Opus 5가 AI 에이전트를 노린 심각한 보안 위협을 대폭 억제했을 가능성이 제시되었다. Opus 5를 같은 회사의 Auto Mode와 결합한 환경에서는 브라우저 상에서 동작하는 AI 에이전트에 대한 프롬프트 주입 공격의 성공률이 129건의 테스트 시나리오 전체에서 0퍼센트가 되었다고 보도되고 있다.
프롬프트 주입이란 악의적인 지시를 정상 콘텐츠 사이에 섞어 놓아 AI 에이전트를 조종하는 공격 기법이다. 예를 들어 웹 페이지의 눈에 띄지 않는 곳에 "이 파일을 전송하시오"와 같은 명령을 숨겨 두면, AI가 그 내용을 읽을 때 원래의 지시가 아닌 공격자가 의도한 행동을 취하게 된다. AI가 브라우저를 통해 정보 수집과 조작을 자율적으로 수행하게 될수록 이 공격의 영향 범위는 넓어진다.
테스트 결과에 따르면 Auto Mode에 의한 보호층이 없는 상태에서 Opus 5 단독으로 사용한 경우 프롬프트 주입의 성공률은 3.7퍼센트였다. Opus 5와 Auto Mode를 결합함으로써 이 수치가 0이 되었다고 하며, 추가 보호 메커니즘이 실질적인 방어 효과를 가져오고 있다. 다만 이 결과는 129개의 테스트 시나리오에 기반한 것이며, 현 시점에서는 실제 운영 환경에서의 재현성에 대해 확인이 필요한 단계이다.
AI 에이전트의 보안 문제는 업계 전체가 고민해 온 과제로 오랫동안 인식되어 왔다. AI가 자율적으로 브라우저를 조작하거나 외부 서비스와 연계하는 사례가 증가할수록 프롬프트 주입은 단순한 연구 대상의 위협이 아닌 실제 피해를 초래하는 공격 경로로 주목받아 왔다. 지금까지 효과적인 방지책을 제시한 사례는 제한적이었으며, 이번 결과는 업계에 하나의 참조점이 될 수 있다고 위치 지어진다.
다만 테스트 환경에서의 성능이 현실의 안전성을 직접 보장하는 것은 아니라는 점에 주의할 필요가 있다. 테스트 시나리오가 실제 공격 기법을 어디까지 포함하고 있는지는 공개되지 않았으며, 공격 쪽도 방어 기법에 맞춰 변화한다는 관점을 가질 수 있다. Anthropic이 향후 어떤 조건과 데이터를 바탕으로 이 성과를 검증할 것인지가 평가의 열쇠를 쥐고 있다.
AI 에이전트가 업무와 일상 장면에서 광범위하게 사용되게 될수록 보안의 신뢰성은 도입 판단에 영향을 미치는 요소가 된다. 이번 결과가 외부의 재현 검증을 거쳐 입증된다면 브라우저형 AI 에이전트에 대한 신뢰를 높이는 데 있어 중요한 한 걸음으로 평가될 가능성이 있다. 향후에는 독립적인 제3자의 검증과 보다 광범위한 공격 시나리오에 대한 대응 상황이 주목점이 될 것으로 보인다.
본 기사는 AI issue 편집부가 사실(fact)을 바탕으로 독자적으로 작성·편집한 저작물입니다. 저작권은 AI issue에 있으며, 무단 전재·재배포 및 AI 학습·활용을 금합니다.