SageMaker HyperPod로 혁신하는 멀티모달 RL과 멀티 리전 분산 학습

AWS가 대규모 AI 워크로드를 가속화하기 위해 SageMaker HyperPod 기반의 두 가지 핵심 분산 학습 아키텍처를 공개했습니다. 첫째는 SkyRL 프레임워크와 GRPO 알고리즘을 활용해 시각-언어 모델(Qwen3-VL-8B)의 에이전트 다단계 탐색 성공률을 43.75%에서 95% 이상으로 끌어올린 멀티모달 강화학습 구조입니다. 둘째는 Qumulo의 Cloud Data Fabric과 NeuralCache를 접목해 60ms의 네트워크 지연이 존재하는 리전 간 학습 환경에서도 로컬과 동일한 115~117 samples/sec의 처리량과 99% 수준의 GPU 가동률을 달성한 멀티 리전 스토리지 파이프라인입니다. 이를 통해 복잡한 AI 에이전트 학습의 연산 낭비를 줄이고 글로벌 데이터 분산 환경에서의 인프라 확장성을 동시에 확보했습니다.

AI 에이전트와 분산 학습의 새로운 인프라 병목 과제

대규모 언어 모델(LLM)과 비전-언어 모델(VLM)이 단순 질의응답을 넘어 복잡한 환경에서 연속적으로 판단하고 행동하는 '에이전트' 단계로 진화하면서, 사후 학습(Post-training) 단계의 핵심으로 강화학습(Reinforcement Learning, RL)이 급부상하고 있습니다. 에이전트형 모델은 일련의 궤적(Trajectories)을 생성하고, 환경으로부터 보상을 수신하며, 결과에 기반해 정책을 갱신하는 다단계(Multi-turn) 탐색을 수행합니다. 이 과정은 수백 GPU-시간 규모의 롤아웃(Rollout) 연산과 고도의 분산 인프라를 요구합니다.

동시에 글로벌 AI 개발 현장에서는 인프라 가용성과 데이터 거버넌스의 불일치라는 또 다른 물리적 장벽에 직면해 있습니다. 최첨단 모델 학습을 위한 대규모 GPU 클러스터가 위치한 리전과 실제 페타바이트급 학습 데이터셋이 저장된 리전이 서로 다를 경우, 크로스 리전 네트워크 지연(Latency)과 데이터 전송 비용으로 인해 GPU가 데이터 로딩을 기다리며 유휴 상태에 빠지는 현상이 발생합니다.

Amazon Web Services(AWS)는 이러한 AI 인프라의 양대 병목을 해결하기 위해 Amazon SageMaker HyperPod를 중심으로 한 두 가지 최적화 파이프라인 실증 결과를 발표했습니다. 하나는 오픈소스 강화학습 프레임워크인 SkyRL과 GRPO(Group Relative Policy Optimization)를 결합한 멀티모달 RL 학습 최적화이며, 다른 하나는 Cloud Native Qumulo(CNQ) 및 CDF(Cloud Data Fabric)를 활용한 무복제(Zero-copy) 멀티 리전 분산 학습 아키텍처입니다.

---

멀티모달 에이전트를 위한 SkyRL과 GRPO 분산 아키텍처

전통적인 단일 턴(Single-turn) RL은 모델의 단일 출력에 즉각 보상을 부여하지만, 2D 미로 찾기와 같은 순차적 환경을 탐색하는 멀티 턴 RL은 에피소드 전체에 걸쳐 누적된 보상을 통해 정책을 학습합니다. 목표 지점에 도달했을 때만 1.0의 보상이 주어지는 희소 보상(Sparse reward) 환경에서는 개별 스텝에 대한 정답 레이블이 존재하지 않으므로, 정책 최적화 알고리즘의 효율성이 성능을 결정짓습니다.

AWS 연구진은 별도의 비평가(Critic)나 가치 모델(Value model) 없이도 동작하는 GRPO 알고리즘을 채택했습니다. 에이전트가 동일한 시작 위치에서 여러 경로를 생성하면, GRPO는 해당 그룹 내 실행 결과들을 상호 비교하여 그룹 평균을 상회하는 궤적을 강화하고 뒤처지는 궤적을 억제하는 방식으로 정책을 갱신합니다.

  1. 환경 관측 및 이미지 입력
  2. vLLM 롤아웃 궤적 생성
  3. GRPO 그룹 상대 비교
  4. FSDP 정책 모델 가중치 갱신
  5. FSx for Lustre 어댑터 동기화

이 과정에서 연산 자원의 낭비를 막기 위해 학습(Training)과 추론(Rollout) 엔진을 동일 GPU에 공존시키는 Colocation 구조가 적용되었습니다.

구성 요소할당 인스턴스 및 사양세부 역할
워커 노드 (Worker)3x ml.g7e.12xlarge (총 6x NVIDIA RTX PRO 6000 Blackwell GPU)FSDP 정책 모델 샤딩 및 6개 vLLM 롤아웃 엔진 병렬 실행
헤드 노드 (Head)1x ml.r5d.16xlarge (512 GB RAM)Ray GCS 관리, 대시보드 호스팅, 체크포인트 저장 시 LoRA 샤드 CPU 메모리 병합
공유 스토리지Amazon FSx for Lustre (ReadWriteMany PVC)체크포인트, LoRA 가중치 동기화, 평가 데이터 공유

"GRPO post-training on HyperPod improves the maze solve rate from 43.75% to more than 95% on a fixed 64-maze evaluation set."

Qwen3-VL-8B 모델을 기반으로 VisGym SFT 체크포인트에서 출발한 GRPO 사후 학습은 고정된 64개 미로 평가 셋에서 탐색 성공률을 초기 43.75%에서 95% 이상으로 대폭 향상시켰습니다. 또한 SageMaker HyperPod의 자동 노드 복구 기능과 20스텝 주기 체크포인팅(`ckpt_interval=20`)을 결합하여, 하드웨어 장애 발생 시에도 처음부터 다시 시작하지 않고 직전 스텝부터 즉각 재개할 수 있는 탄력성을 확보했습니다.

---

멀티 리전 분산 학습의 데이터 병목을 해결하는 Qumulo Cloud Data Fabric

대규모 모델 학습 시 컴퓨팅 자원(GPU)과 데이터셋이 서로 다른 리전에 존재할 때, 수 페타바이트의 데이터를 물리적으로 복제하는 것은 엄청난 비용과 동기화 지연을 유발합니다. SageMaker HyperPod와 Cloud Native Qumulo(CNQ)의 결합은 원격 리전 간에 데이터를 사전에 복제하지 않고도 단일 리전 수준의 I/O 성능을 유지하는 Zero-copy 아키텍처를 제시합니다.

실증 테스트는 허브 클러스터(미국 동부 오하이오 `us-east-2`, 데이터 원본 위치)와 스포크 클러스터(미국 서부 오레곤 `us-west-2`, 원격 연산) 사이에서 진행되었습니다. 두 리전은 60ms의 네트워크 왕복 지연을 가진 VPC 피어링으로 연결되었습니다.

Hub 단일 리전 (us-east-2)116
Spoke 웜업 초기 (0-150 배치)100
Spoke 수렴 후 (150+ 배치)116

이 아키텍처의 핵심 메커니즘은 다음과 같습니다.

평가 항목허브 단일 리전 (us-east-2)스포크 콜드 스타트 (0~150 배치)스포크 웜업 완료 (150+ 배치)
학습 처리량 (Samples/sec)115 ~ 11795 ~ 105 (일시적 지연 노출)115 ~ 117 (허브와 동일 수준 수렴)
GPU 평균 가동률 (%)98 ~ 100%80 ~ 90%98 ~ 100% (최대 99% 이상)
스토리지 읽기 레이턴시2 ~ 3 ms (최대치)원격 네트워크 지연 영향서브 5 ms (로컬 NVMe 히트)

10.2억 파라미터(1.02B)의 LLaMA v3 모델을 16대의 H100 GPU(클러스터당 2x `ml.p5.48xlarge`)로 학습한 결과, 원격 스포크 클러스터는 150배치 이후 허브와 동일한 115~117 samples/sec 처리량과 98~100%의 GPU 가동률에 도달했습니다. 10만 배치 이상의 대규모 학습 작업에서 150배치의 초기 웜업 시간은 전체 수행 시간의 0.1% 미만에 불과하여 연산 손실이 사실상 무시할 수 있는 수준임이 입증되었습니다.

---

엔터프라이즈 AI 인프라의 패러다임 전환과 시사점

이번 AWS의 실증 결과들은 대규모 모델의 사후 학습과 인프라 운영 방식에 중대한 전환점을 시사합니다.

첫째, 멀티모달 RL 파이프라인에서 연산과 메모리 배치의 고도화입니다. SkyRL과 GRPO, 그리고 vLLM-FSDP Colocation의 결합은 강화학습이 요구하는 막대한 추론 및 정책 학습 연산을 단일 인프라 풀 안에서 유휴 시간 없이 흡수할 수 있음을 보여주었습니다. 특히 별도의 크리틱 모델을 제거하여 VRAM 점유를 최소화하면서 시각 미로 탐색 성공률을 2배 이상 끌어올린 점은, 향후 로보틱스, GUI 에이전트, 자율주행 등 복잡한 환경 상호작용 모델의 학습 비용을 획기적으로 낮출 수 있는 설계 경로를 제공합니다.

둘째, 글로벌 분산 AI 인프라에서 '데이터 중심'에서 '컴퓨트 유연성 중심'으로의 운영 전환입니다. 데이터셋 복제 없이 원격 리전의 가용 GPU 클러스터를 즉시 투입할 수 있게 됨에 따라, 특정 리전의 가속기 품귀 현상에 구애받지 않고 글로벌 인프라 자원을 유연하게 배분할 수 있습니다. 이는 엔터프라이즈가 직면한 스토리지 이중화 비용과 데이터 동기화 리스크를 제거하면서도 최상위 GPU 자원의 가동률을 99% 수준으로 유지할 수 있는 현실적인 해법을 제시합니다.

Chiffres vérifiés

Notre avis

AI 모델이 점차 거대해지고 다단계 추론 에이전트로 발전함에 따라, 알고리즘의 발전만큼이나 스토리지 캐싱과 컴퓨팅 코로케이션 같은 하부 인프라 엔지니어링의 정밀함이 전체 R&D 속도와 비용을 좌우하게 될 것입니다. 단일 데이터 복사본을 유지하면서 글로벌 GPU 풀을 즉시 가동하는 무복제 분산 아키텍처와 연산 유휴 시간을 없앤 통합 롤아웃 기법은 향후 엔터프라이즈 AI 플랫폼의 필수 표준으로 자리잡을 것으로 전망됩니다.

Questions ouvertes

Source

Retour au catalogue