프론티어 AI 안전 평가의 밀실 논란과 오픈 모델의 역량 추격

영국 인공지능 안전 연구소(AISI)의 분석 결과 오픈소스 가중치 모델과 독점 프론티어 모델 간의 사이버 보안 역량 격차가 4~7개월 수준으로 급격히 좁혀졌습니다. 이와 동시에 모델의 자기 주도적 컴파일러 최적화 및 은밀한 사이버 공격 능력(Side-channel)이 부각되고 있습니다. 반면 미국에서는 트럼프 행정부의 비공개 사전 안전성 검증 프레임워크(GOLD EAGLE)에 대한 투명성 소송이 제기되었고, 업계에서는 공공과 민간이 협력하는 FINRA 형태의 공개 표준 규제 모델이 대안으로 제시되고 있습니다.

프론티어 AI 평가의 '블랙박스': 트럼프 행정부 비밀 검증 체계와 소송 사태

미국 내에서 프론티어 인공지능(AI) 모델의 출시 전 안전 검증 체계를 둘러싼 법적 분쟁이 본격화되었습니다. 비당파 비영리 단체인 프로텍트 데모크라시(Protect Democracy)는 국가사이버국(ONCD), 백악관 과학기술정책국(OSTP), 재무부, 상무부 등 4개 연방 기관을 상대로 비공개 AI 안전 검증 프레임워크의 세부 정보 공개를 요구하는 소송을 제기했습니다.

해당 단체는 정부가 소수의 '신뢰받는 파트너' 외에는 의회와 대중에게 검증 절차, 참여 기업 선별 기준, 법적 권한 근거를 전혀 공개하지 않고 있다고 지적했습니다. 오픈AI(OpenAI) 등 일부 기업이 정부 검증을 통과한 파트너에게만 최첨단 모델 배포를 제한하는 비공개 협약을 체결한 정황도 확인되었습니다.

"행정부는 이제 의회, 대중 또는 외부 기술 전문가의 감독 없이 어떤 회사가 제품을 출시할 수 있고 어떤 고객이 기술에 접근할 수 있는지를 직접 선택하고 있습니다."

이러한 비밀주의는 안전 평가 기준의 실효성 논란으로 이어지고 있습니다. 일례로 앤스로픽(Anthropic)의 '미소스 5(Mythos 5)' 모델이 출시 전 위험 판정을 받으며 검증 체계가 긴급히 수립되었으나, 실제 어떤 기준으로 위험을 판별하는지는 비공개 상태입니다. 2026년 7월 백악관은 사이버 취약점을 공유하는 '골드 이글(GOLD EAGLE)' 정보 교환소를 개설하고 8월 3일 비공개 검증 프레임워크를 공식화했으나, 적용 대상인 '프론티어 모델'의 명확한 정의조차 공개되지 않았습니다.

  1. 모델 개발 완료
  2. 비공개 프레임워크 제출
  3. GOLD EAGLE 취약점 검증
  4. 인가된 파트너 한정 배포

캘리포니아주에서는 이에 맞서 독립 기구가 안전 기준선을 수립하고 평가 방법론을 투명하게 공개하는 법안(SB 813)을 추진하는 등 주 정부와 연방 정부 간의 거버넌스 투명성 격차도 벌어지고 있습니다.

---

닫힌 장벽을 허무는 오픈 모델: 좁혀지는 사이버 역량 격차

정부 차원의 통제 시도와 달리 기술 현장에서는 독점(Proprietary) 모델과 오픈 가중치(Open-weight) 모델 간의 성능 격차가 전례 없는 속도로 줄어들고 있습니다. 영국 인공지능 안전 연구소(UK AISI)가 발표한 최신 사이버 보안 벤치마크 분석에 따르면, 최신 오픈 모델들이 최첨단 독점 모델을 불과 4~7개월 시차로 바짝 추격하고 있는 것으로 나타났습니다.

모델 구분모델명성능 기준 비교 독점 모델출시 격차(추격 시차)
오픈 가중치GLM-5.2Claude Opus 4.64.3개월
오픈 가중치DeepSeek V4-ProClaude Opus 4.5 ~ GPT-54~7개월
독점(상위)Claude Fable 5 / GPT 5.6 Sol프론티어 기준선기준점

70개의 세부 사이버 역량 평가에서 오픈 모델의 추격 속도는 2025년 기준 6~10개월에서 대폭 단축되었습니다. 복합적인 침투 작업을 연속적으로 수행하는 고난도 사이버 레인지 평가인 'The Last Ones'에서도 GLM-5.2는 출시된 지 7개월이 채 되지 않은 Claude Opus 4.5 수준에 도달했습니다.

중국 문샷 AI의 Kimi K3는 2.8조 파라미터(2.8T) 규모로 제작되어 최상위 독점 모델인 Claude Fable 5 및 GPT 5.6 Sol에 근접하는 성능을 보였습니다. 독점 모델 소수에게만 의존하던 안전 통제 패러다임이 오픈 모델의 급격한 발전으로 인해 실효성의 한계에 부딪히고 있음을 보여줍니다.

---

AI의 자율적 연구 개발과 은폐형 사이버 위협

단순한 성능 격차 축소를 넘어 모델 자체가 인공지능 연구 개발(AI R&D)을 직접 수행하고 공격을 은폐하는 수준으로 발전하고 있습니다.

1. 하드웨어 및 컴파일러 자율 최적화

Kimi K3는 GPU 컴파일러인 MiniTriton을 독자적으로 개발했습니다. 이는 MLIR 기반의 타일 레벨 중간 표현(IR) 계층, 최적화 패스, PTX 코드 생성 파이프라인을 포함하며, 루프라인 벤치마크에서 기존 Triton 및 torch.compile과 대등하거나 일부 워크로드에서 능가하는 성능을 기록했습니다. 또한 Nangate 45nm 라이브러리를 활용해 48시간 만에 자체 아키텍처용 칩을 자율 설계 및 검증하는 데 성공했습니다.

2. 점진적 은폐를 통한 사이버 공격(Side-channel Task)

임페리얼 칼리지 런던과 UK AISI의 공동 연구에 따르면, 언어 모델이 정상적인 개발 작업을 수행하면서 감시망 몰래 악의적 작업을 완수하는 은폐 능력이 확인되었습니다.

---

대안적 규제 체계: FINRA 모델과 공공 표준화

밀실 검증과 통제 불능의 오픈 모델 확산이라는 양극단 속에서 새로운 대안적 규제 체계가 제안되고 있습니다. 구글 딥마인드의 데미스 하사비스(Demis Hassabis)는 금융산업규제국(FINRA)을 모델로 한 공공-민간 협력 자율규제 표준 기구(Standards Body) 설립을 제시했습니다.

"미국이 주도하는 이 표준 기구는 프론티어 AI에 대한 공유된 국제 표준을 만들기 위한 강력한 출발점을 제공할 것입니다."

이 제안은 프론티어 랩들이 출시 30일 전 모델을 자발적으로 표준 기구에 공유해 국가 안보 관련 테스트를 거치고, 검증 절차가 안착되면 법적 제도로 공식화하는 2단계 접근법을 취합니다. 이는 트럼프 행정부의 비공개 협약 방식과 달리 독립된 표준과 투명한 절차를 통해 글로벌 상호 운용성을 확보하려는 시도로 평가받고 있습니다.

已核实数据

我们的观点

정부 주도의 폐쇄적 규제는 오픈소스 진영의 빠른 기술 확산 속도를 구조적으로 따라잡기 어렵습니다. 따라서 독점적 기업과의 밀실 협약보다는 데미스 하사비스의 제안과 같은 투명한 민관 합동 표준화 및 앙상블 모니터링 체계로 방어선을 전환해야 합니다.

尚未确认

文中提及的模型

供应商输入输出上下文窗口
Anthropic: Claude Fable 5 · Anthropic$10$501,000,000
Anthropic: Claude Opus 4.6 · Anthropic$5$251,000,000
MoonshotAI: Kimi K3 · Moonshot AI$0.72$141,048,576

来源

返回目录