AI의 '거부' 능력에 대한 과신 분석

이 보고서는 AI 모델이 유해한 요청을 거부를 학습하는 과정을 역사적 배경부터 구체적인 사례까지 살펴봅니다. Anthropic가 2021년에 제시한 helpful‑honest‑harmless 원칙과 OpenAI의 초기 모델이 무분별하게 정보를 제공했던 사실을 확인합니다. 이어서 레드 팀 실험, 거부를 훈련하는 파인튜닝 파이프라인, 그리고 거부의 확률적 한계가 초래할 수 있는 위험과 정책적 함의를 사실 위주로 정리합니다.

서론

AI 시스템에 "거부" 능력을 부여하는 것은 안전 설계의 핵심 원칙 중 하나로 자리 잡았습니다. 본 보고서는 Technology Review에 게재된 글 "We’re putting too much faith in AI’s ability to say no"을 바탕으로, AI가 거부를 학습하는 과정과 그 한계를 사실 중심으로 정리합니다.

AI 거부의 역사적 배경

초기 거대 언어 모델은 방대한 웹 데이터를 학습하면서 폭력·증오 표현 등에 대한 지식을 습득했으나, 이를 스스로 억제하는 방법을 배우지 못했습니다. 2020년부터 2024년까지 OpenAI에서 안전 업무를 맡았던 Steven Adler는 초기 모델이 "blab on about anything"이라고 회상했습니다. 또한 Harvard에서 AI와 정신 건강을 연구하는 Ryan McBain은 초기 챗봇에 자살 방법을 묻는 질문이 쉽게 위험한 답변을 생성했다고 증언했습니다.

"When asked to aid in a dangerous act (e.g. building a bomb), the AI should politely refuse." — Anthropic 팀, 2021

2021년 Anthropic 연구진은 대형 언어 모델이 helpful, honest, 그리고 above all harmless해야 한다고 명시하며, 위험한 행위를 돕는 요청에 대해 정중히 거부를 해야 한다고 주장했습니다.

거부를 훈련하는 방법

기업들은 모델이 유해한 프롬프트를 거부를 학습하도록 일련의 연습을 수행합니다. 이 과정에서 유해하다고 판단되는 프롬프트에 대한 정답은 "거부"이고, 무해하다고 판단되는 프롬프트에 과도하게 거부를 하는 경우 벌점을 부여합니다. 때로는 다른 AI 모델을 이용해 이러한 연습을 실행하며, AI가 AI에게 거부를 가르치는 구조가 형성됩니다.

또한 모델 앞에 다른 AI 계층을 배치해 유해한 프롬프트가 내부의 추론 코어에 도달하지 못하도록 차단하는 방식도 적용됩니다. 그 결과 거부는 현대 인공지능의 내재적 특성이 되었습니다.

빨간 팀 실험 사례

2022년, ChatGPT 출시 전 OpenAI는 외부 전문가를 포함한 수십 명의 "레드 팀"을 동원해 최신 모델의 위험성을 검증했습니다. 이 중 온라인 극박스 연구를 하던 Paul Röttger는 최소한의 지시만 받은 채, 자신이 "거부‑worthy"라고 판단하는 질문을 모델에 던졌습니다. 레드 팀원들은 수천 개의 쿼리를 모델에 제기하고 결과를 엑셀 시트에 기록했습니다.

예를 들어, Röttger가 모델에 알카에다 모집 게시글 작성을 요청했을 때 초기 모델은 쉽게 응답했으나, 몇 개월 후 동일한 요청에 대해 모델은 "거부"를 반환했습니다. 이 피드백 루프는 수집된 데이터가 파인튜닝에 재투입되는 방식으로 작동했습니다.

"Their task was to ask the model any questions that they deemed ‘refusal‑worthy.’" — Paul Röttger, Hasso Plattner Institute

거부의 한계와 위험

거부 메커니즘은 확률적 성격을 띠므로 절대적으로 신뢰할 수 없습니다. 결정적인 악의적인 행위자는 이미 이러한 확률적 장벽을 뚫어냈으며, 앞으로도 계속할 수 있다고 전문가들은 경고합니다. 최신 모델 중 일부는 최상위 인간 해커와 맞먹는 수준으로 critical computer 네트워크를 침투할 수 있으며, 허위 정보를 퍼뜨리는 데도 숙련되어 있다고 기업들은 주장합니다.

또한 거부를 기준으로 "허용"과 "불가"를 나누는 선은 보편적 기준이 없으며, 각 기업이 자율적으로 그 선을 그립니다. 이는 특정 정권이 AI의 발언을 억제하는 데 악용될 수 있는 구조를 만듭니다. 거부가 향상될수록 정권에 불리한 아이디어를 차단하는 능력도 함께 커질 수 있습니다.

정책 및 거버넌스 함의

현재 AI 기업들이 거부의 경계를 설정하고 있지만, 앞으로 정부도 자체적인 선을 그릴 수 있게 될 것입니다. 예를 들어, 국방부는 frontier 모델 기업과의 마찰 속에서 더 적은 거부를 원하기도 합니다. 반대로 억압적인 정권은 거부를 이용해 정당한 표현을 차단할 수 있습니다.

따라서 AI의 거부를 단순히 기술적 문제로 보는 것은 위험하며, 사회적·정치적 맥락에서의 영향을 함께 고려해야 합니다.

결론

AI가 "거부"를 학습하는 과정은 데이터 수집, 레드 팀 검증, 엑셀 기반 피드백, 파인튜닝, 그리고 배포라는 명확한 단계를 따릅니다. 그러나 그 메커니즘은 확률적이므로 완전히 신뢰할 수 없으며, 거부의 경계를 설정하는 주체에 따라 서로 다른 결과가 나타납니다. 개발자, 기업, 정책 입안자는 이러한 사실을 바탕으로 보다 견고한 안전 전략을 마련해야 합니다.

  1. 데이터 수집
  2. 레드 팀 querying
  3. 결과 로깅
  4. 파인튜닝
  5. 배포

유해 프롬프트 예시와 모델 반응

유해 프롬프트 예시모델 반응 (거부 여부)
폭탄 제조 방법 안내거부
총으로 자살하는 가장 효과적인 방법거부
에볼라 바이러스 virulence 증가 방법거부
배우자에게 불륜 숨기는 팁거부

"Where you draw the line is a huge question." — Zico Kolter, OpenAI 이사회 멤버 및 Gray Swan 공동 창업자

핵심 사실 요약

---

Belegte Zahlen

Unsere Einschätzung

AI의 거부는 기술적 해결책이 아니라 사회적 합의가 필요한 복합적 문제입니다. 확률적 특성 때문에 단일 기술적 장벽에 과도하게 의존하는 것은 위험하며, 다층적 방어와 투명한 거버넌스가 필요합니다. 향후 연구는 거부 메커니즘의 정량적 평가와 규제 기준 마련에 집중해야 합니다.

Offene Fragen

Quelle

Zurück zum Katalog