SageMaker HyperPod 멀티테넌트

이 보고서는 Amazon SageMaker HyperPod을 이용해 여러 팀이 하나의 GPU 클러스터를 안전하게 공유하는 방법을 설명합니다. AWS IAM Identity Center를 통한 중앙 집중식 인증과 Kubernetes 네임스페이스 기반 워크로드 격리를 중심으로 아키텍처를 살펴봅니다. 또한 HyperPod Task Governance와 네임스페이스 수준 비용 할당을 통해 공정한 자원 배분과 투명한 비용 관리가 가능함을 보여줍니다.

개요

Amazon SageMaker HyperPod은 대규모 생성형 AI 워크로드를 위한 전용 컴퓨팅 클러스터를 관리하는 서비스이다. 여러 팀이 동일한 GPU 클러스터를 공유하면서도 각각의 작업 환경을 격리하고 비용을 투명하게 할당할 수 있도록 설계되었다. 본문에서는 AWS가 제시한 멀티 테넌트 아키텍처를 중심으로 인증, 권한, 워크로드 배치, 스토리지, 비용 할당 등의 요소를 살펴본다.

아키텍처 구성 요소

아키텍처는 왼쪽에서 오른쪽 순으로 사용자 신원 인증, 권한 부여, 격리된 워크로드 네임스페이스로 흐른다. 사용자는 AWS IAM Identity Center를 통해 인증한다. Identity Center는 외부 ID 공급자(예: Microsoft Entra ID)와 페더레이션되어 workforce ID를 중앙에서 관리한다. 각 팀은 별도의 권한 집합(TeamA permission set, TeamB permission set)을持ち、Identity Center가 해당 권한 집합에 IAM 역할을 자동으로 프로비저닝한다(예: TeamA‑permissionset‑role, TeamB‑permissionset‑role). 이 역할은 CLI 콘솔 및 SageMaker Studio 접근 시 IAM 주체로 사용된다.

인증 및 접근 제어

인증 단계에서는 사용자가 `aws sso login` 명령을 실행하여 Identity Center 포털로 리다이렉트된 후 임시 자격 증명을 얻는다. 이 자격 증명은 `kubectl` 로 EKS 클러스터에 직접 접근하는 데 사용된다. 또 다른 경로는 Identity Center 포털에서 SageMaker Studio 애플리케이션을 선택하여 팀 전용 SageMaker AI 도메인에 로그인하는 방식이다. 각 도메인은 팀별 실행 역할(TeamA‑role, TeamB‑role)을 갖으며, 이 역할은 스튜디오 GUI에서 작업을 제출할 때 EKS에 대한 권한을 부여한다. EKS 경계에서는 액세스 엔트리가 IAM 역할을 Kubernetes RBAC 정책과 매핑하여, 각 팀의 네임스페이스 내에서만 리소스에 접근할 수 있도록 제한한다. 따라서 클라이언트 또는 콘솔을 통한 요청이라도 사용자는 자신의 네임스페이스 밖의 리소스를 볼 수 없다.

  1. AWS IAM Identity Center
  2. CLI login
  3. kubectl
  4. EKS

워크로드 격리 및 리소스 관리

클러스터 상단에는 두 개의 플랫폼 레이어가 위치한다. HyperPod Observability는 모니터링 및 대시보드 기능을 제공하고, HyperPod Task Governance는 컴퓨팅 쿼터 관리 및 스케줄링 우선순위를 결정한다. 이들 레이어 아래에서 클러스터는 Kubernetes namespaces로 나뉘며, 예시에서는 Team A용 네임스페이스 A와 Team B용 네임스페이스 B가 존재한다. 각 네임스페이스 안에서 팀은 HyperPod Spaces(대화형 개발 환경), HyperPod PyTorch jobs(분산 학습 워크로드), HyperPod Inference endpoints(모델 서빙)를 실행할 수 있다. 이와 같이 네임스페이스 수준에서의 격리는 팀 간 간섭을 방지하면서도 동일한 GPU 인프라를 효율적으로 공유하게 한다.

스토리지 및 비용 할당

스토리지는 두 계층으로 구성된다.

비용 할당 측면에서는 네임스페이스 수준에서 비용 추적이 이루어져, 각 팀이 소비한 GPU 비용을 별도로 확인하고 내부 청구(chargeback)에 활용할 수 있다. 이를 통해 관리자는 무분별한 리소스 소비를 방지하고 비용 투명성을 높일 수 있다.

운영 및 관측 가능성

운영 관점에서 HyperPod은 노드 상태 모니터링, 장애 복구, 클러스터 수명 주기 관리를 자동으로 수행한다. 관리자는 HyperPod Observability를 통해 클러스터 전체의 메트릭을 대시보드로 확인할 수 있으며, HyperPod Task Governance를 통해 우선순위 기반 스케줄링 정책을 정의함으로써 공정한 리소스 배분을 보장한다. 이와 같은 기능은 별도의 운영 오버헤드 없이도 다중 팀 환경에서의 안정적인 운영을 가능하게 한다.

編集部の見解

이 아키텍처는 대기업 내 AI 팀 간 자원 경합을 줄이고 운영 효율성을 높이는 실용적인 접근법이다. 특히 IAM Identity Center와의 통합은 기존 기업 ID 시스템과의 연동을 간소화한다. 다만 실제 구현 시 네트워크 지연과 스토리지 성능 검증이 필요할 것이다.

未確認の点

出典

カタログへ