에이전트 프라이버시·보안: 컨텍스트 기반 접근법

구글 연구진은 2025년 말 뉴욕에서 열린 CAPS 워크숍을 바탕으로 에이전트 프라이버시와 보안의 과제를 정리한 보고서를 공개했습니다. 보고서는 에이전트가 개인 데이터에 접근하고 consequential한 행동을 수행해야 하는 딜레마를 강조하며, 컨텍스트 인티그리티 이론을 바탕으로 시스템·모델·사용자 수준에서의 다층적 방어 전략을 제시합니다. 구체적으로는 동적 정책 생성 루프를 갖춘 컨텍스트 정책 엔진, 시스템 레벨 샌드박스, 모델 수준의 적절성 추론, 사용자 중심의 동적 제어 메커니즘이 핵심 제안사항입니다.

워크숍 개요 및 참여 규모

구글 연구진의 유진 바그다사리안(Eugene Bagdasarian) 연구 과학자와 마르코 그루터스(Marco Gruteser) 수석 과학자는 2025년 말 뉴욕시에서開催された Google Contextual Agent Privacy and Security (CAPS) Workshop 을 통해 more than 50 명 이상의 학계 및 산업 전문가와 협업하여 워크숍 보고서를 제작했습니다. 이 보고서의 제목은 "Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle" 입니다.

"To be useful, AI agents must understand and be constrained by contextual behavioral norms to ensure they act appropriately."

워크숍은 에이전트가 유용하기 위해서는 개인 데이터에 접근하고 다양한 맥락에서 consequential한 행동을 수행할 수 있어야 한다는 전제에서 시작되었습니다. 이와 동시에 이러한 유연성이 프라이버시와 보안에 새로운 도전을 만든다는 점을 강조했습니다.

에이전트 프라이버시·보안의 핵심 과제

보고서는 에이전트가 전통적인 결정적 소프트웨어와 세 가지 중요한 차원에서 다르다고 지적합니다. 첫째, Unstructured interfaces and input ambiguity 로서 자연어나 이미지와 같은 비정형 입력을 처리함으로써 "예상되는 행동"을 정의하거나 프롬프트 인젝션과 같은 적대적 조작에 대한 보호를 어렵게 만듭니다. 둘째, Probabilistic control flows 로서 생성형 계획에 기인한 확률적 실행 경로는 기존 테스트 방법론으로는 쉽게 보안할 수 없습니다. 셋째, Autonomy and delegation 로서 에이전트가 장시간 작업을 처리하고 하위 작업을 다른 에이전트에 위임할 때 전통적인 사용자 감독이 효과적이지 못해 "확인 피로"(confirmation fatigue) 위험이 증가합니다.

이 세 가지 차원은 에이전트가 유용하게 작동하기 위해 필요한 데이터 접근과 행동 자율성이 프라이버시와 보안에 미치는 영향을 동시에 고려해야 함을 보여줍니다.

컨텍스트 인티그리티 이론 적용

보고서는 프라이버시를 단순히 비밀 유지나 통제가 아닌 "적절한 정보 흐름"으로 정의하는 Contextual Integrity (CI) 이론을 기반으로 합니다. CI에 따르면 context‑specific 정보 규범은 세 가지 요소로 구성됩니다.

예를 들어, 사용자는 가상 쇼핑 어시스턴트에게 선물 쇼핑 목록을 공유하려는 의향이 있지만 가족이나 친구에게는 공유하지 않으려 할 수 있습니다. 보고서는 이 개념을 정보 공유에서 에이전트의 행동 적절성으로 확장하여 contextual security 라고 명명합니다.

컨텍스트 정책 엔진 아키텍처

보고서는 고수준의 컨텍스트 규범과 저수준 시스템 권한 사이의 의미적 격차를 메우기 위해 컨텍스트 정책 엔진 을 제안합니다. 이 엔진은 감독층(supervisor layer)의 일부로 작동하며, 실시간으로 정책을 생성하고 적절성을 평가하는 동적 정책 생성 루프를 포함합니다.

  1. 사용자 요청 수신
  2. 컨텍스트 분석
  3. 동적 정책 생성
  4. 적절성 평가
  5. 행동 실행

이 흐름은 에이전트가 외부 도구나 데이터를 호출하기 전에 요청된 데이터 흐름이 사회·맥락적으로 적절한지 판단할 수 있게 합니다. 엔진은 런타임에 새롭게 발견된 도구나 기능도 고려하여 정책을 지속적으로 갱신할 수 있습니다.

다층적 방어 접근법

컨텍스트 정책 엔진과 함께 보고서는 시스템, 모델, 사용자 세 수준에서의 보완적 조치를 제시합니다.

시스템 수준 샌드박스

실행 환경은 추가적인 가드레일을 부과하여 에이전트 또는 모델 오류의 영향을 제한하고 탐지 및 대응을 용이하게 할 수 있습니다. 전통적인 운영 체제는 정적 파일·네트워크 접근 제한으로 샌드박스를 구현하지만, 에이전트에 대해서는 다음과 같은 동적 조치가 탐색됩니다.

모델 수준 추론

복잡한 작업을 수행하는 에이전트는 자신의 행동이 적절한지 판단해야 하며, 예를 들어 사용자 데이터를 공유할지 여부를 결정해야 합니다. 향후 연구는 모델이 애매한 사용자 프롬프트를 해소하고 변화하는 컨텍스트 규범 하에서 적절성을 추론할 수 있도록 해야 합니다.

사용자 중심 제어

기존의 "Notice and Choice" 프레임워크는 사용자가 개인 데이터에 영향을 미치는 행동을 미세하게 결정할 수 있다고 가정하지만, 에이전트의 자율적 행동은 확률적이며 높은 양을 생성하므로 이 가정은 타당하지 않습니다. 보고서는 사용자의 정신 모델과 일치하는 동적, 컨텍스트 기반, 개인화된 제어 메커니즘으로의 전환을 탐색합니다.

시사점 및 향후 연구 방향

보고서는 컨텍스트 인티그리티를 에이전트 보안 프레임워크의 기초로 삼을 때 다음과 같은 연구 방향을 제시합니다.

이러한 방향들은 에이전트가 실 세계에서 안전하고 사회적으로 적절하게 작동하도록 하는 데 필요한 기술적, 제도적 기반을 마련하는 것을 목표로 합니다.

Belegte Zahlen

Unsere Einschätzung

보고서는 에이전트가 실 세계에서 유용하게 작동하기 위해 필요한 데이터 접근과 행동 자율성을 동시에 다루는 프레임워크를 제시한다는 점에서 시사적입니다. 컨텍스트 인티그리티를 기술적 메커니즘에 연결하려는 시도는 향후 표준화 노력의 기초가 될 수 있습니다. 다만 구체적인 구현 지표나 성능 평가가 부족하여 실제 도입 시 검증이 필요할 것으로 보입니다.

Offene Fragen

Quelle

Zurück zum Katalog