Google은 Chrome의 에이전트 브라우징 기능을 위한 다층 보안 구상을 제시하며, 작업을 자동으로 수행할 수 있는 브라우저가 직면한 가장 큰 위협인 간접 프롬프트 인젝션에 초점을 맞춥니다. 이러한 공격은 악성 웹사이트나 iframe 또는 사용자 리뷰와 같은 제3자 콘텐츠에 삽입된 뒤, 에이전트가 금융 거래를 시작하거나 민감한 데이터를 외부로 전송하는 등 사용자의 목표와 일치하지 않는 작업을 수행하도록 유도할 수 있습니다.
Google은 Chrome의 안전한 에이전트 브라우징 설계가 사내 보안 전문가와의 협업, Gemini에 적용된 보호 기능 및 에이전트 보안 원칙을 바탕으로 했다고 말합니다. 제안된 아키텍처는 결정론적 방어와 확률적 방어를 결합해 에이전트 악용을 더 어렵고 비용이 많이 들게 하며, 영향이 큰 작업을 실행할 때 사용자가 통제권을 유지하도록 합니다.
에이전트 작업을 검토하는 독립 모델
Gemini는 계획 단계에서 Chrome이 공유한 페이지 콘텐츠를 바탕으로 다음 단계를 결정합니다. 그러나 이러한 콘텐츠는 본질적으로 신뢰할 수 없으므로 계획 모델은 작업의 흐름을 바꾸려는 영향 시도에 노출될 수 있습니다. Google은 Spotlighting과 같은 기술을 사용해 모델이 페이지에 포함된 지시보다 사용자 및 시스템 지시를 우선하도록 유도하며, Gemini가 알려진 공격을 피하도록 관련 공격을 학습 과정에도 포함했습니다.
Google은 추가 계층으로 User Alignment Critic이라는 구성 요소를 도입합니다. Gemini를 사용해 구축된 별도의 모델인 이 구성 요소는 고신뢰 구성 요소로 작동합니다. 계획이 완료된 뒤 각 제안 작업을 검사하며, 특정 질문에 집중합니다. 즉, 해당 작업이 사용자가 지정한 목표에 기여하는지 확인합니다. 작업이 목표와 일치하지 않는다고 판단하면 이를 거부할 수 있습니다.
이 구성 요소는 필터링되지 않은 웹 콘텐츠를 보지 않고, 제안된 작업과 관련된 메타데이터만 확인합니다. 이러한 구조는 제공되는 맥락을 줄이지만, 작업을 승인하거나 거부하는 단순한 역할을 악성 콘텐츠로부터 더 잘 격리합니다. 작업이 거부되면 비평 모델은 계획 모델에 피드백을 보내 계획을 다시 작성하도록 하며, 실패가 반복될 경우 시스템은 사용자에게 통제권을 돌려줄 수 있습니다.
에이전트가 접근할 수 있는 사이트 범위 제한
Google은 사이트 격리와 동일 출처 정책의 원칙을 Agent Origin Sets라는 개념을 통해 에이전트 환경으로 확장합니다. 에이전트는 한 사이트에서 구성 요소를 수집한 뒤 다른 사이트에서 장바구니를 채우는 것처럼 여러 사이트에 걸쳐 작업해야 합니다. 그러나 침해된 에이전트에 임의의 사이트와 상호작용할 수 있는 제한 없는 권한을 부여하면 사이트 격리를 우회하고 로컬 로그인 세션에서 데이터를 유출하는 경로가 될 수 있습니다.
신뢰할 수 있는 제어 기능은 작업과 관련된 출처를 결정하고, 각 세션에 대해 이를 두 개의 명확한 그룹으로 나눕니다.
- 읽기 전용 출처: Gemini가 해당 출처의 콘텐츠를 사용할 수 있습니다. iframe의 출처가 이 그룹에 포함되지 않으면 해당 iframe의 콘텐츠는 모델에 표시되지 않습니다.
- 읽기 및 쓰기 출처: 에이전트가 해당 출처에서 읽고 클릭이나 입력과 같은 작업을 수행할 수 있습니다.
이러한 분리는 작업과 관련 없는 출처 사이에서 데이터가 전달될 가능성을 줄이며, 브라우저가 읽기 그룹 외부의 데이터를 애초에 모델에 전송하지 않도록 합니다. 계획 모델은 새 출처를 임의로 추가할 수 없으며, 제어 기능의 승인이 필요합니다. 웹과 관련되지 않은 콘텐츠에도 유사한 분리가 적용됩니다. 예를 들어 도구 호출을 읽기 호출과 쓰기 호출로 구분하고 작업에 적합한지 확인합니다.
새 출처로의 이동도 검토 대상입니다. 계획 모델이 읽기 그룹에 없는 출처로 이동하자고 제안하면, User Alignment Critic의 복제본이 해당 출처가 작업과 관련 있는지 확인한 뒤 이를 추가하고 이동을 시작합니다. Chrome은 또한 모델이 생성한 URL을 알려진 공용 URL로 제한하는 결정론적 검사를 사용합니다. 모델이 구성한 URL이 개인 정보를 외부로 내보내는 데 악용될 수 있기 때문입니다. 페이지가 자동으로 새 출처로 이동하는 경우에도 동일한 검토가 적용됩니다.
Google은 사용자의 작업이 이러한 경계와 어떻게 상호작용하는지 알기 전에는 처음부터 경계를 조정하기 어렵다는 점을 인정합니다. 따라서 초기에는 읽기 및 쓰기 집합을 추적하는 더 단순한 자산 제어 버전을 적용했으며, 마찰을 줄이고 보안을 개선하기 위해 제어 기능과 시스템의 나머지 요소를 조정할 계획입니다.
사용자 확인 및 민감한 작업 모니터링
Chrome은 탭 내부의 작업 기록에 에이전트의 단계를 표시하므로 사용자는 진행 상황을 실시간으로 확인할 수 있으며, 언제든 작업을 중지하거나 통제권을 되찾을 수 있습니다. 이러한 투명성은 영향이 큰 작업 전에 사용자 확인을 요청하는 여러 결정론적 검사와 모델 기반 검사를 뒷받침합니다.
주요 중단 지점은 다음과 같습니다.
- 결정론적으로 민감한 사이트 목록을 검사한 결과를 바탕으로 은행 거래나 개인 의료 정보와 관련된 사이트 등 민감한 사이트로 이동하기 전에 확인을 요청합니다.
- Google Password Manager를 사용해 사이트에 로그인하기 전에 확인을 요청하며, 저장된 비밀번호를 모델에 직접 제공하지 않습니다.
- 구매 또는 결제 완료, 메시지 전송이나 그 밖에 결과가 발생하는 작업과 같은 작업 전에 중지한 뒤, 권한을 요청하거나 사용자가 다음 단계를 수행하도록 요청합니다.
탐지, 테스트 및 대응
시스템은 에이전트가 보는 모든 페이지를 검사해 간접 프롬프트 인젝션을 찾습니다. 동시에 Chrome은 Safe Browsing과 기기 내 인공지능을 통해 기존 사기 수법을 실시간으로 탐지합니다. 프롬프트 인젝션 분류기는 계획 모델의 추론과 병렬로 작동하며, 페이지 콘텐츠가 사용자의 목적에서 에이전트를 벗어나게 하기 위해 작업을 유도했다고 판단하면 해당 작업을 차단할 수 있습니다. Google은 분류기가 가능한 모든 악성 영향을 탐지하지는 못한다는 점을 인정하지만, 이는 다층 방어를 구성하는 추가 계층입니다.
이러한 제어 기능의 효과를 검증하기 위해 Google은 에이전트를 경로에서 벗어나게 하려는 격리된 악성 웹사이트를 생성하는 자동 공격 테스트 시스템을 구축했습니다. 테스트는 보안 연구원이 작성한 공격으로 시작한 뒤, 언어 모델과 브라우저 에이전트에 맞게 조정된 기술을 사용해 공격을 확장합니다. 테스트는 소셜 미디어의 사용자 게시물과 광고처럼 널리 퍼진 콘텐츠와 금융 거래 또는 자격 증명 유출처럼 지속적인 피해를 일으킬 수 있는 공격에 초점을 맞춥니다. Google은 공격 성공률을 사용해 엔지니어링 변경 사항을 평가하고 회귀를 방지하며, Chrome의 자동 업데이트를 통해 수정 사항을 신속하게 배포합니다.
Google은 외부 연구원이 Chrome의 에이전트 기능에 집중할 수 있도록 취약점 보상 프로그램의 지침을 업데이트했으며, 보안 경계 침해를 입증하는 심각한 취약점에 대해 최대 20,000달러를 지급하겠다고 밝혔습니다. 회사는 웹 에이전트 보안이 여전히 초기 단계의 분야이며, 테스트와 보안 연구 커뮤니티와의 협력이 계속됨에 따라 이러한 보호 기능도 발전할 것이라고 강조합니다.