워크숍 개요 및 참여 규모
구글 연구진의 유진 바그다사리안(Eugene Bagdasarian) 연구 과학자와 마르코 그루터스(Marco Gruteser) 수석 과학자는 2025년 말 뉴욕시에서開催された Google Contextual Agent Privacy and Security (CAPS) Workshop 을 통해 more than 50 명 이상의 학계 및 산업 전문가와 협업하여 워크숍 보고서를 제작했습니다. 이 보고서의 제목은 "Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle" 입니다.
"To be useful, AI agents must understand and be constrained by contextual behavioral norms to ensure they act appropriately."
워크숍은 에이전트가 유용하기 위해서는 개인 데이터에 접근하고 다양한 맥락에서 consequential한 행동을 수행할 수 있어야 한다는 전제에서 시작되었습니다. 이와 동시에 이러한 유연성이 프라이버시와 보안에 새로운 도전을 만든다는 점을 강조했습니다.
에이전트 프라이버시·보안의 핵심 과제
보고서는 에이전트가 전통적인 결정적 소프트웨어와 세 가지 중요한 차원에서 다르다고 지적합니다. 첫째, Unstructured interfaces and input ambiguity 로서 자연어나 이미지와 같은 비정형 입력을 처리함으로써 "예상되는 행동"을 정의하거나 프롬프트 인젝션과 같은 적대적 조작에 대한 보호를 어렵게 만듭니다. 둘째, Probabilistic control flows 로서 생성형 계획에 기인한 확률적 실행 경로는 기존 테스트 방법론으로는 쉽게 보안할 수 없습니다. 셋째, Autonomy and delegation 로서 에이전트가 장시간 작업을 처리하고 하위 작업을 다른 에이전트에 위임할 때 전통적인 사용자 감독이 효과적이지 못해 "확인 피로"(confirmation fatigue) 위험이 증가합니다.
이 세 가지 차원은 에이전트가 유용하게 작동하기 위해 필요한 데이터 접근과 행동 자율성이 프라이버시와 보안에 미치는 영향을 동시에 고려해야 함을 보여줍니다.
컨텍스트 인티그리티 이론 적용
보고서는 프라이버시를 단순히 비밀 유지나 통제가 아닌 "적절한 정보 흐름"으로 정의하는 Contextual Integrity (CI) 이론을 기반으로 합니다. CI에 따르면 context‑specific 정보 규범은 세 가지 요소로 구성됩니다.
- Actors: 정보를 보내고 받는 주체(누가 누구에 대한 정보를 전달하는가)
- Information types: 의료 기록, 금융 기록 등 특정 카테고리의 정보
- Transmission principles: 기밀성, 상호성 등 정보 흐름을 규율하는 규칙
예를 들어, 사용자는 가상 쇼핑 어시스턴트에게 선물 쇼핑 목록을 공유하려는 의향이 있지만 가족이나 친구에게는 공유하지 않으려 할 수 있습니다. 보고서는 이 개념을 정보 공유에서 에이전트의 행동 적절성으로 확장하여 contextual security 라고 명명합니다.
컨텍스트 정책 엔진 아키텍처
보고서는 고수준의 컨텍스트 규범과 저수준 시스템 권한 사이의 의미적 격차를 메우기 위해 컨텍스트 정책 엔진 을 제안합니다. 이 엔진은 감독층(supervisor layer)의 일부로 작동하며, 실시간으로 정책을 생성하고 적절성을 평가하는 동적 정책 생성 루프를 포함합니다.
- 사용자 요청 수신
- 컨텍스트 분석
- 동적 정책 생성
- 적절성 평가
- 행동 실행
이 흐름은 에이전트가 외부 도구나 데이터를 호출하기 전에 요청된 데이터 흐름이 사회·맥락적으로 적절한지 판단할 수 있게 합니다. 엔진은 런타임에 새롭게 발견된 도구나 기능도 고려하여 정책을 지속적으로 갱신할 수 있습니다.
다층적 방어 접근법
컨텍스트 정책 엔진과 함께 보고서는 시스템, 모델, 사용자 세 수준에서의 보완적 조치를 제시합니다.
시스템 수준 샌드박스
실행 환경은 추가적인 가드레일을 부과하여 에이전트 또는 모델 오류의 영향을 제한하고 탐지 및 대응을 용이하게 할 수 있습니다. 전통적인 운영 체제는 정적 파일·네트워크 접근 제한으로 샌드박스를 구현하지만, 에이전트에 대해서는 다음과 같은 동적 조치가 탐색됩니다.
- 에이전트 역량의 동적 제한
- 에이전트 식별 수립
- 컨텍스트 변화에 따른 데이터 접근 권한의 부여 및 취소
모델 수준 추론
복잡한 작업을 수행하는 에이전트는 자신의 행동이 적절한지 판단해야 하며, 예를 들어 사용자 데이터를 공유할지 여부를 결정해야 합니다. 향후 연구는 모델이 애매한 사용자 프롬프트를 해소하고 변화하는 컨텍스트 규범 하에서 적절성을 추론할 수 있도록 해야 합니다.
사용자 중심 제어
기존의 "Notice and Choice" 프레임워크는 사용자가 개인 데이터에 영향을 미치는 행동을 미세하게 결정할 수 있다고 가정하지만, 에이전트의 자율적 행동은 확률적이며 높은 양을 생성하므로 이 가정은 타당하지 않습니다. 보고서는 사용자의 정신 모델과 일치하는 동적, 컨텍스트 기반, 개인화된 제어 메커니즘으로의 전환을 탐색합니다.
시사점 및 향후 연구 방향
보고서는 컨텍스트 인티그리티를 에이전트 보안 프레임워크의 기초로 삼을 때 다음과 같은 연구 방향을 제시합니다.
- 머신러닝 모델이 컨텍스트 규칙을 이해하고 기계가 읽을 수 있는 정책을 생성하는 방법
- 동적 정책 생성 루프의 지연 시간과 정확도를 보장하는 시스템 아키텍처 설계
- 사용자가 컨텍스트 기반 제어를 직관적으로 이해하고 활용할 수 있는 인터페이스 연구
- 에이전트 간 위임 시 적절성 검증을 위한 표준 프로토콜 개발
이러한 방향들은 에이전트가 실 세계에서 안전하고 사회적으로 적절하게 작동하도록 하는 데 필요한 기술적, 제도적 기반을 마련하는 것을 목표로 합니다.