SageMaker HyperPod로 본 차세대 분산 학습과 데이터 병목 극복

거대 인공지능 모델 훈련이 사후 강화학습(RL)과 멀티 리전 분산 환경으로 확장되면서 인프라 탄력성과 데이터 전송 효율성이 핵심 과제로 떠올랐습니다. AWS는 SageMaker HyperPod를 기반으로 SkyRL 프레임워크를 적용해 VLM 미로 탐색 성공률을 43.75%에서 95% 이상으로 끌어올렸으며, Qumulo의 NeuralCache 기술을 통해 60ms 지연이 발생하는 리전 간 학습 환경에서도 데이터 복제 없이 단일 리전 대비 98~100%의 GPU 처리량을 달성했습니다. 본 리포트는 연산과 추론의 GPU 코로케이션 최적화 기법과 신경망 기반 프리캐싱을 통한 초저지연 스토리지 아키텍처를 상세히 분석합니다.

AI 분산 인프라의 두 가지 도전 과제: RL 사후 학습과 지리적 데이터 분산

거대 언어 모델(LLM)과 비전-언어 모델(VLM)의 개발 패러다임이 단순 사전 학습(Pre-training)을 넘어 다단계 추론을 강화하는 사후 학습(Post-training)과 글로벌 분산 학습으로 진화하고 있습니다. 에이전트 역량을 극대화하기 위한 강화학습(RL)은 수백 GPU-시간의 롤아웃(Rollout) 생성과 정책 업데이트가 반복되는 긴 사이클을 필요로 하며, 단 한 번의 하드웨어 장애로도 수 시간 분량의 학습 진행 상황이 유실될 위험을 내포하고 있습니다.

동시에 대규모 모델 학습에 필요한 수천 대 규모의 고성능 GPU 클러스터와 페타바이트급 훈련 데이터셋이 서로 다른 AWS 리전에 위치하는 현상이 빈번해졌습니다. 데이터를 매번 타 리전으로 복제하는 방식은 막대한 네트워크 전송 비용과 지연 시간을 유발하며, 원격 리전에서 직접 데이터를 읽어오는 방식은 I/O 병목으로 인해 고가의 GPU가 유휴 상태에 머무는 심각한 자원 낭비를 초래합니다.

Amazon SageMaker HyperPod는 자동 노드 교체 및 체크포인트 복구와 같은 복원력(Resiliency)을 기반으로 이러한 분산 인프라 병목을 해결하는 핵심 플랫폼으로 자리 잡았습니다. 본 분석에서는 HyperPod 상에서 오픈소스 SkyRL 프레임워크를 활용한 멀티모달 강화학습 최적화 사례와, Qumulo의 Cloud Data Fabric(CDF) 및 NeuralCache를 연계하여 리전 간 데이터 복제 없이 최고 수준의 처리량을 달성한 멀티 리전 아키텍처를 심층 분석합니다.

---

SkyRL과 GRPO를 활용한 비전-언어 모델(VLM) 다중 턴 강화학습

표준적인 단일 턴 강화학습이 모델의 단일 출력값에 보상을 부여하는 것과 달리, 에이전트의 다중 턴(Multi-turn) 강화학습은 '상태 관측 → 행동 선택 → 환경 피드백 수신 → 다음 상태 전이'로 이어지는 전체 시퀀스 궤적(Trajectory)에 대해 누적 보상을 학습합니다. 2차원 미로 탐색과 같은 문제에서는 목표 지점에 도달했을 때만 1.0의 희소 보상(Sparse reward)이 제공되며, 개별 이동에 대한 정답 레이블이 존재하지 않습니다.

AWS 연구팀은 이를 해결하기 위해 SkyRL 오픈소스 프레임워크와 그룹 상대 정책 최적화(GRPO, Group Relative Policy Optimization) 알고리즘을 도입했습니다. GRPO는 동일한 미로 시작 지점에서 현재 정책으로 여러 궤적을 샘플링한 후, 그룹 내 상대적 성과를 비교하여 평균을 초과한 시퀀스를 강화하는 방식입니다. 별도의 비평가(Critic)나 가치 모델(Value model) 없이도 강력한 학습 신호를 생성할 수 있는 것이 특징입니다.

  1. 미로 이미지 관측 및 vLLM 롤아웃 생성
  2. GRPO 그룹 내 상대적 우위 평가
  3. FSDP 기반 정책 모델 그래디언트 업데이트
  4. FSx for Lustre 통한 LoRA 가중치 동기화

실험은 VisGym SFT(Supervised Fine-Tuning) 체크포인트를 초기 가중치로 사용한 Qwen3-VL-8B 모델을 대상으로 진행되었습니다. VisGym SFT 모델은 미로 구조를 파싱하고 정형화된 행동을 출력할 수 있지만 탐색 성공률은 43.75%에 불과했습니다. HyperPod 기반 GRPO 사후 학습을 적용한 결과, 64개 미로로 구성된 고정 평가 셋에서 성공률이 95% 이상으로 급격히 상승했습니다.

---

연산 자원 극대화: vLLM과 FSDP의 단일 GPU 코로케이션 아키텍처

강화학습 파이프라인에서 추론(Rollout)과 학습(Policy Update)을 별도의 GPU 풀로 분리하면 한쪽 단계가 진행되는 동안 다른 쪽 GPU 풀이 대기 상태에 머무는 '핑퐁 현상'이 발생하여 연산 자원이 낭비됩니다. SkyRL은 `trainer.placement.colocate_all=true` 설정을 통해 단일 GPU 내에 vLLM 추론 엔진과 PyTorch FSDP(Fully Sharded Data Parallel) 학습 워커를 동일 노드 및 동일 GPU에 코로케이션(Colocation)시켰습니다.

이 아키텍처에서는 FSDP 샤드와 vLLM의 KV 캐시가 동일한 GPU 메모리를 공유하므로 `gpu_memory_utilization=0.45`로 보수적으로 설정되어 메모리 오버플로우를 방지합니다. 매 옵티마이저 스텝이 완료될 때마다 업데이트된 LoRA 어댑터 가중치는 FSx for Lustre를 통해 즉각 vLLM 엔진으로 동기화됩니다. 또한 `ml.r5d.16xlarge` 헤드 노드의 512GB 대용량 메모리는 체크포인트 저장 시 워커 노드들로부터 전달되는 LoRA 어댑터 샤드들을 안정적으로 통합하는 데 활용됩니다.

SageMaker HyperPod의 자동 복원 기능은 `ckpt_interval=20` 설정과 결합되어 하드웨어 고장 시 자동으로 노드를 교체하고 마지막 저장된 체크포인트부터 중단 없이 학습을 재개할 수 있도록 지원합니다.

---

Qumulo Cloud Data Fabric과 NeuralCache를 통한 원격 데이터 장벽 해소

대규모 분산 학습에서 발생하는 또 다른 병목인 원격 데이터 접근 문제를 해결하기 위해, AWS는 Cloud Native Qumulo(CNQ) 및 Cloud Data Fabric(CDF) 기술을 SageMaker HyperPod와 결합했습니다. 이 아키텍처는 원본 데이터셋을 단일 리전(Hub)에만 유지하면서도, 다른 원격 리전(Spoke)의 GPU 클러스터가 로컬 스토리지와 다름없는 속도로 데이터에 접근할 수 있도록 설계되었습니다.

"CDF keeps a single authoritative copy of your dataset on the hub cluster and projects it to spoke clusters as a unified POSIX namespace."

CDF의 핵심 엔진인 NeuralCache는 AI 모델을 활용해 데이터로더의 순차적 4KB 블록 읽기 패턴을 실시간으로 학습합니다. 작업이 데이터 요청을 실제로 발행하기 전에 필요한 블록을 예측하여 원격 Hub 리전에서 Spoke 리전의 로컬 NVMe 스토리지로 미리 프리페치(Pre-fetch)합니다. 네트워크 왕복 시간(RTT)이 60ms 이상인 장거리 링크에서도 패킷 손실에 의존하지 않고 대역폭과 전파 지연을 정밀하게 측정하는 고급 혼잡 제어(Congestion Control) 알고리즘을 적용하여 최대 900ms RTT 환경에서도 회선 한계 속도에 근접한 처리량을 유지합니다.

---

단일 리전 vs 멀티 리전 성능 실증 검증

AWS 연구팀은 Hub 리전(미국 동부 오하이오 `us-east-2`)에 C4 토큰화 데이터셋(4,840만 개 시퀀스, 4,096 토큰 윈도우)을 배치하고, Spoke 리전(미국 서부 오레곤 `us-west-2`)에 SageMaker HyperPod 클러스터를 구성하여 10.2억(1.02B) 파라미터 규모의 LLaMA v3 모델 학습을 수행했습니다. 각 클러스터는 2대의 `ml.p5.48xlarge` 인스턴스(총 16개 NVIDIA H100 GPU)로 구성되었으며 VPC 피어링을 통해 연결되었습니다.

인프라 배치 구성캐시 상태네트워크 RTT초당 처리 샘플 수 (Samples/sec)GPU 활용률 (GPU Utilization)캐시 히트율 / I/O 지연 시간
단일 리전 (Hub)로컬 직접 접근< 3ms115 ~ 11799% (지속)1.0~1.3 GBps 대역폭 / 2~3ms
멀티 리전 (Spoke)Cold Start (초기 100~150 배치)~60ms95 ~ 10580 ~ 90%신경망 학습 단계 (15~20% 저하)
멀티 리전 (Spoke)Warm Cache (150 배치 이후)~60ms115 ~ 11798 ~ 100%94~96% 히트율 / sub-5ms

실험 결과, 캐시가 전혀 없는 최악의 콜드 스타트(Cold start) 상황에서도 NeuralCache는 초기 100~150개 배치(전체 10,000 배치 기준 1% 미만, 100,000 배치 기준 0.1% 미만의 시간) 내에 데이터 접근 패턴 학습을 완료했습니다. 웜업이 완료된 이후에는 94~96%의 읽기 요청이 로컬 NVMe 캐시에서 5ms 미만의 지연 시간으로 처리되었으며, 원격 Spoke 클러스터의 학습 처리량은 단일 리전 Hub 클러스터와 완전히 동일한 115~117 samples/sec에 도달했습니다.

이러한 결과는 글로벌 분산 환경에서 페타바이트급 데이터 복제 비용을 들이지 않고도 전 세계 가용 GPU 자원을 즉각적인 모델 훈련에 투입할 수 있음을 입증합니다.

已核实数据

我们的观点

GPU 수급 불균형과 거대 모델 학습 비용이 급증하는 상황에서 연산과 데이터 스토리지를 논리적으로 결합하되 물리적으로 분리할 수 있는 아키텍처가 엔터프라이즈 AI의 필수 표준이 될 것입니다. 특히 사후 학습 단계의 RL 롤아웃 연산 최적화와 리전 간 데이터 가상화 기술은 AI 인프라의 실질적 TCO를 낮추는 결정적인 전환점이 될 것으로 전망합니다.

尚未确认

来源

返回目录