MLflow와 세이지메이커 AI 모델 레지스트리 동기화 거버넌스

AWS가 세이지메이커 AI의 관리형 MLflow와 세이지메이커 AI 모델 레지스트리 간의 심화 동기화 기능 및 멀티 계정 거버넌스 아키텍처를 공개했습니다. 훈련 메트릭, 모델 평가 카드, 추론 사양, 계보 데이터가 레지스트리로 자동 연동되어 데이터 사이언티스트와 거버넌스 관리자의 역할이 체계적으로 분리됩니다. 기업은 보안 규제 및 조직 구조에 맞춰 단일 계정, 중앙 허브 앤 스포크, 완전 격리 하이브리드 토폴로지를 선택할 수 있습니다.

실험과 프로덕션 거버넌스 간의 단절 극복

머신러닝(ML) 워크플로에서 데이터 사이언티스트가 수십 번의 실험을 수행하는 환경과 거버넌스 책임자가 규제 준수 및 안정성을 검증하는 환경 사이에는 지속적인 단절이 존재해 왔습니다. 데이터 사이언티스트는 주피터 노트북(Jupyter Notebook) 환경에서 MLflow를 중심으로 실험을 추적하지만, 거버넌스 담당자는 프로덕션 배포 전 모델을 감사하고 승인할 수 있는 공신력 있는 단일 레지스트리가 필요합니다.

기존에는 모델 동기화가 이루어지더라도 훈련 지표, 평가 결과, 계보(Lineage) 정보가 누락되어 검증을 위해 MLflow로 되돌아가 수작업으로 맥락을 수집해야 했습니다. Amazon SageMaker AI의 관리형 MLflow와 SageMaker AI Model Registry 간의 최신 동기화 기능은 이 간극을 제거하고 전체 수명주기 거버넌스를 자동화합니다.

"동기화가 활성화되면 데이터 사이언티스트가 MLflow에 등록하는 모든 모델은 SageMaker AI Model Registry에 상응하는 Model Package Group과 Package 버전을 생성하며, 훈련 메트릭, 평가 메트릭, 배포 가능한 추론 사양, 실행 계보를 함께 전달합니다."

  1. MLflow 모델 로깅 및 등록
  2. 메타데이터 및 추론 사양 자동 추출
  3. SageMaker Model Registry 동기화
  4. IAM 조건 기반 승인 및 EventBridge CI/CD 배포

4대 메타데이터 자동 동기화 아키텍처

모델 등록 모드를 AutoModelRegistrationEnabled로 설정하면 단 한 번의 MLflow 호출로 모델 패키지가 자동 생성됩니다. 이때 동기화 파이프라인은 네 가지 핵심 메타데이터를 SageMaker AI Model Registry로 전송합니다.

이러한 워크플로는 sagemaker-mlflow 플러그인(v0.5.0 이상)을 기반으로 동작하며, 모델 로깅 시점에 추론 컨테이너 이미지를 함께 기록하는 기능과 세션 주입(`use_session()`, `set_session()`)을 통한 멀티 계정 자격 증명 서명을 지원합니다.

단일 계정 환경에서의 IAM 기반 역할 분리

소규모 팀이나 개발 초기 단계에서는 단일 AWS 계정 내에서 AWS Identity and Access Management(IAM) 가드레일을 적용해 데이터 사이언티스트와 거버넌스 담당자의 권한을 분리합니다. 데이터 사이언티스트는 실험을 진행하고 MLflow 별칭(`sagemakerlifecycle-staging-pending` 등)을 지정해 모델을 스테이징 단계로 전환할 수 있습니다.

플랫폼 관리자는 IAM 조건 키인 `sagemaker:ModelLifeCycle/stage` 및 `sagemaker:ModelLifeCycle/stageStatus`를 구성하여 데이터 사이언티스트 역할의 프로덕션 승인 권한을 제한합니다. 거버넌스 담당자만이 Studio UI에서 동기화된 지표와 계보를 검토한 후 승인(Approved) 상태로 변경할 수 있으며, 리소스 태그 조건을 활용해 승인 완료된 패키지의 변경을 차단할 수 있습니다.

멀티 계정 환경을 위한 2가지 거버넌스 토폴로지

엔터프라이즈 환경에서는 개발 계정과 프로덕션 계정을 격리하며, 조직의 규제 요구사항에 따라 허브 앤 스포크 중앙 거버넌스 또는 허브 앤 스포크 하이브리드 거버넌스 패턴을 선택할 수 있습니다.

비교 항목토폴로지 1: 중앙 집중형 허브 앤 스포크토폴로지 2: 격리형 하이브리드주요 차이점 및 특징
MLflow 호스팅 위치Hub (거버넌스 계정)Spoke (개발 계정별 로컬)Hub 앱 공유 vs 계정별 독립 앱
Spoke 계정 쓰기 범위Hub S3 및 Hub MLflow에 직접 쓰기Spoke 로컬 환경에만 쓰기 (Hub 직접 쓰기 없음)프로덕션급 계정 쓰기 차단 여부
크로스 계정 공유 기술AWS RAM (MLflow 앱 및 패키지 그룹)AWS RAM (대상 그룹) + EventBridge 복제RAM 공유 리소스 범위의 차이
배포 시 아티팩트 참조Hub S3 아티팩트 직접 참조Spoke 로컬 아티팩트 직접 참조런타임 크로스 계정 종속성 유무
추천 대상 조직다중 개발팀 보유 대규모 일반 기업금융/의료 등 엄격한 규제 준수 환경보안 및 격리 수준에 따른 구분

패턴 1: 허브 앤 스포크 중앙 거버넌스

중앙 거버넌스(Hub) 계정에서 호스팅되는 MLflow 앱을 AWS Resource Access Manager(AWS RAM)을 통해 여러 개발(Spoke) 계정으로 공유합니다. 개발 계정의 데이터 사이언티스트가 공유된 MLflow 앱 ARN을 추적 URI로 지정하여 모델을 등록하면, Hub 계정의 레지스트리에 모델 패키지가 동기적으로 생성됩니다.

패턴 2: 허브 앤 스포크 하이브리드 거버넌스

규제 대상 조직에서는 개발 워크로드가 프로덕션급 Hub 계정에 직접 쓰는 것을 금지합니다. 이 패턴에서는 각 개발 계정이 자체 MLflow 앱과 자체 로컬 모델 레지스트리를 보유하여 Hub와 완전히 격리된 상태로 운영됩니다.

1. 데이터 사이언티스트가 개발 계정의 로컬 MLflow 앱에 모델을 등록하고 로컬 레지스트리에 자동 동기화합니다. 2. 개발 계정의 모델 소유자(Model Owner)가 로컬 레지스트리에서 1차 검토 및 승인을 수행합니다. 3. 로컬 승인 이벤트는 복제 워크플로를 트리거하여 모델 아티팩트를 Hub S3 버킷으로 복제하고, 추론 사양을 Hub 경로로 재작성한 후 Hub의 공유 대상 그룹에 등록합니다. 4. 복제된 패키지는 `CustomerMetadataProperties`에 소스 패키지 ARN과 소스 계정 정보를 보존하여 독립적인 엔티티로 등록되며, Hub 거버넌스 담당자가 이를 최종 재검증 및 승인합니다.

승인 이벤트 기반 CI/CD 배포 자동화

두 토폴로지 모두 모델 레지스트리의 상태 변경이 배포 파이프라인의 진입 게이트 역할을 수행합니다. 거버넌스 담당자가 모델 승인 상태를 Approved로 변경하면 Amazon EventBridge로 상태 변경 이벤트가 발행됩니다.

CI/CD 파이프라인은 해당 이벤트를 수신하여 검증된 모델 패키지를 기반으로 Amazon SageMaker 엔드포인트를 프로비저닝하거나 업데이트합니다. 이를 통해 모델의 학습, 평가, 거버넌스 승인, 실기 배포에 이르는 전 과정이 인위적인 개입 없이 안전한 감사 추적(Audit Trail)을 유지하며 운영됩니다.

確認された数値

編集部の見解

MLflow의 유연한 실험 추적 기능과 SageMaker Model Registry의 엄격한 엔터프라이즈 거버넌스가 결합되면서 데이터 사이언티스트와 거버넌스 조직 간의 운영 마찰이 대폭 줄어들 것입니다. 특히 AWS RAM과 EventBridge를 결합한 멀티 계정 아키텍처는 엔터프라이즈 AI 플랫폼 엔지니어링의 사실상 표준 청사진을 제시하고 있습니다.

未確認の点

出典

カタログへ