사이버 보안

Google이 Workspace에서 간접 프롬프트 인젝션 공격에 지속적으로 대응하는 방법

Google은 Gemini가 적용된 Workspace와 같은 다중 데이터 소스 인공지능 애플리케이션을 겨냥한 간접 프롬프트 인젝션 공격에 대응하기 위한 지속적인 방법론을 설명합니다. 이 방법론은 공격 탐지, 분류, 합성 데이터 생성, 결정론적 방어와 머신러닝 모델 및 LLM 업데이트, 그리고 Gemini 모델 자체의 강화에 기반합니다.

2026-04-02
4 분 읽기
7 조회수
فريق تحرير certi.news
Google이 Workspace에서 간접 프롬프트 인젝션 공격에 지속적으로 대응하는 방법

Google은 간접 프롬프트 인젝션(IPI)을 한 번 해결하고 끝낼 수 있는 문제가 아니라 진화하는 위협으로 다룹니다. 이러한 공격은 Gemini가 적용된 Workspace와 같이 여러 데이터 소스와 도구를 처리하는 인공지능 애플리케이션을 겨냥합니다. 공격자는 사용자의 직접적인 입력이 없더라도 모델이 사용자 요청을 실행하는 동안 사용하는 데이터나 도구에 악성 지시를 삽입할 수 있습니다.

Google 생성형 인공지능 보안 팀의 Adam Gavish가 게시한 블로그 글에서 Google은 자동화 에이전트에 대규모 언어 모델의 사용이 확대되고 모델이 처리하는 콘텐츠가 다양해지면서 적대적 공격을 위한 환경이 끊임없이 변하고 있다고 설명합니다. 이에 따라 Google은 보안 연구, 공격 테스트, 합성 데이터, 애플리케이션 제어, 머신러닝 모델 및 언어 모델 업데이트를 결합한 지속적인 접근 방식을 구축하고 있습니다.

여러 소스에서 공격 탐지

프로세스는 공격자가 더 넓은 범위에서 악용하기 전에 새로운 공격 경로를 발견하고 목록화하는 것에서 시작합니다. Google은 이를 위해 인간 기반 레드팀 테스트를 포함한 내부 및 외부 프로그램을 활용합니다. 전문 팀은 실제 사용자 프로필을 기반으로 한 공격을 실행해 보안 및 안전성 취약점을 발견하고, 이후 제품 팀과 협력해 발견된 문제를 해결합니다.

Google은 머신러닝이 지원하는 동적 프레임워크를 통한 자동화된 공격 테스트도 사용합니다. 이러한 프레임워크는 공격 페이로드를 생성하고 알고리즘적으로 반복 수정해 대규모로 고도화된 위협을 모방합니다. 이를 통해 복잡한 공격 경로를 작성하고 수동 테스트만으로는 다루기 어려운 더 많은 극단적 상황에서 보안 제어의 효율성을 검증할 수 있습니다.

또한 Google AI 취약점 보상 프로그램(Google AI Vulnerability Rewards Program)을 통해 IPI를 활용하는 새로운 공격을 발견한 외부 보안 연구자들과 협력할 수 있습니다. Google은 초대된 연구자들에게 출시 전 기능에 대한 접근 권한을 제공해 새로운 취약점을 발견하도록 하는 정기적인 라이브 해킹 행사도 개최합니다. 이후 각 팀은 문제를 검증하고 재현한 다음 해결합니다.

취약점 목록화 및 공격 데이터 확대

Google은 소셜 미디어, 보도자료, 블로그 등을 포함한 오픈 소스 정보 출처를 통해 공개적으로 보고된 공격도 모니터링합니다. 이러한 출처에서 새로운 취약점을 추출한 뒤 내부적으로 재현하고 목록화해 제품이 영향을 받지 않았는지 확인합니다.

새로운 취약점은 모두 Google Trust, Security, & Safety 팀의 분석을 거칩니다. 이 과정에는 취약점 재현, 중복 여부 확인, 공격 기법 및 영향 범주와의 연결, 관련 담당자 지정이 포함됩니다. 이를 통해 테스트 결과와 외부 출처가 처리 및 추적 가능한 목록으로 전환됩니다.

공격을 발견하고 정제한 뒤 목록화하면 Google은 Simula 도구를 사용해 합성 데이터를 생성하고 새로운 공격의 범위를 확대합니다. 이 단계에서는 공격의 여러 변형을 만들어 완전성과 범위를 개선하고, 훈련 및 검증을 위한 새로운 데이터 세트를 준비할 수 있습니다. 블로그 글에 따르면 이 과정으로 합성 데이터 생성량이 75% 증가했으며, 방어 모델을 평가하고 재훈련하며 방어 효과를 계산하고 보고하는 데 사용되는 데이터 세트를 업데이트할 수 있게 되었습니다.

여러 수준에서 방어 업데이트

Google은 단일 보호 계층에 의존하지 않습니다. 사용자 확인, URL 정제, 도구 순서 지정 정책과 같은 결정론적 방어는 간단한 설정 업데이트를 통해 새로운 공격에 대응합니다. 이러한 제어는 기본 도구 호출, URL 정제, 도구 순서 지정을 위한 설정을 포함하는 중앙 정책 엔진을 통해 관리됩니다. 이를 통해 정규 표현식을 사용해 악성 패턴을 제거하는 것과 같은 수정 작업을 머신러닝 모델이나 언어 모델의 업데이트 주기보다 빠르게 수행할 수 있습니다.

머신러닝 기반 방어는 발견된 공격의 변형을 포함한 합성 데이터를 사용해 재훈련합니다. Google은 이 데이터를 훈련 세트와 검증 세트로 나누어 훈련에 사용하지 않은 예시를 대상으로 효과를 측정합니다. 이 방식은 훈련 및 테스트 데이터의 재현성과 일관성을 확보하는 동시에 향후 완전 자동화된 모델 업데이트로 확장할 수 있는 구조를 구축하는 것을 목표로 합니다.

언어 모델 기반 방어 역시 합성 데이터 예시와 방어 효과에 대해 합의된 지표를 바탕으로 시스템 지시를 개선하는 프롬프트 엔지니어링을 거칩니다. 동시에 Google은 Gemini 모델을 강화해 데이터 내부에 존재하는 악성 지시를 식별하고 무시하면서도 사용자가 의도한 요청은 계속 수행하는 내부 능력을 개선하고 있습니다. Google은 이 과정으로 Gemini의 주입된 지시 탐지 및 무시 능력이 향상되었으며, 정상적인 작업 중 모델 효율성에 영향을 주지 않고 공격 성공률이 낮아졌다고 말합니다.

개선 사항 도입 전 효과 측정

Google은 새로운 제어 기능을 추가하는 데 그치지 않고 Gmail과 Docs 등 여러 Workspace 기능 및 애플리케이션에서 통일된 자산 세트를 사용해 공격을 모의함으로써 평가의 일관성을 확보합니다. 머신러닝 모델 업데이트나 언어 모델 프롬프트 수정과 같은 특정 개선의 실제 영향을 확인하기 위해 Google은 방어 기능을 활성화한 상태와 비활성화한 상태에서 종합 평가를 실행합니다.

이 비교는 변경 사항의 효과를 검증하고 지속적인 개선 주기를 지원하는 ‘전후’ 지표를 제공합니다. Google은 IPI의 특성상 고정된 해결책에 의존하기보다 보안 연구, 자동화된 처리 파이프라인, 고급 모델을 결합한 다층 방어와 반복적인 과정이 필요하다고 봅니다. 에이전트 애플리케이션과 데이터 소스가 발전함에 따라 문제의 형태도 변하기 때문입니다.

뉴스 출처
Google Security Blog
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기