대규모 AI 학습 인프라의 패러다임 전환과 과제
최근 프론티어 AI 모델과 에이전트 개발에서 사후 훈련(Post-training) 단계의 강화학습(RL)과 대규모 분산 훈련 인프라 구축이 표준으로 자리잡고 있습니다. 모델이 다단계 추론과 행동을 거치며 궤적(Trajectories)을 생성하고, 보상을 받아 정책을 업데이트하는 과정은 수백 GPU 시간의 롤아웃(Rollout) 연산을 요구합니다. 이러한 장기 다중 노드(Multi-node) 워크로드에서는 단 한 번의 하드웨어 결함으로도 전체 학습이 중단되거나 수 시간 분량의 연산 결과가 유실될 위험이 존재합니다.
동시에 글로벌 AI 인프라 운영에서는 가용한 최신 가속기(GPU) 클러스터와 대규모 학습 데이터셋이 서로 다른 리전에 분산 배치되는 현상이 빈번하게 발생하고 있습니다. 페타바이트급 데이터를 매번 원격 리전으로 복제하는 작업은 막대한 네트워크 비용과 스토리지 중복을 야기하며, 단순 원격 읽기를 수행할 경우 네트워크 지연으로 인해 GPU 가동률이 급감하는 트레이드오프가 발생합니다.
Amazon Web Services(AWS)는 이러한 연산 복원력과 크로스 리전 데이터 파이프라인 병목 문제를 해결하기 위해 Amazon SageMaker HyperPod를 중심으로 오픈소스 강화학습 프레임워크 SkyRL 및 Qumulo의 클라우드 데이터 패브릭(Cloud Data Fabric, CDF) 기술을 결합한 실증 아키텍처를 공개했습니다.
---
SkyRL과 GRPO를 활용한 멀티모달 강화학습 가속화
시각 언어 모델(Vision-Language Model, VLM)이 다단계 환경에서 의사결정을 내리도록 훈련하는 작업에는 단일 턴(Single-turn) 방식이 아닌 다중 턴(Multi-turn) 강화학습이 적용됩니다. 2D 미로 탐색과 같은 문제에서는 중간 단계마다 별도의 정답 레이블이 존재하지 않으며, 최종 목표 지점에 제한 횟수 내 도달했을 때만 희소 보상(Sparse Reward, 1.0)이 주어집니다.
- 상태 관측(이미지 입력)
- vLLM 롤아웃 생성
- GRPO 그룹 내 비교
- FSDP 정책 업데이트
- FSx 공유 스토리지 LoRA 동기화
이러한 환경에서 SkyRL의 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO) 기법은 별도의 비평가(Critic)나 가치(Value) 모델 없이도 효율적인 학습 신호를 제공합니다. 에이전트는 동일한 시작 위치에서 현재 정책을 바탕으로 여러 개의 경로를 탐색하고, GRPO는 이 결과들을 그룹 내에서 상호 비교하여 평균보다 우수한 궤적을 강화하고 저조한 궤적을 억제합니다.
추론과 학습 연산의 GPU 코로케이션 구조
전통적인 강화학습 분산 환경에서는 롤아웃 생성을 담당하는 추론 GPU 풀과 가중치 업데이트를 담당하는 훈련 GPU 풀이 분리되어 핑퐁(Ping-pong) 형태로 번갈아 대기하는 유휴 시간(Idle time)이 발생했습니다. SkyRL은 동일한 GPU 내에 추론 엔진과 학습 워커를 함께 배치(Colocation)하여 자원 낭비를 차단합니다.
- 작업자 노드 구성: ml.g7e.12xlarge 인스턴스 3대(NVIDIA RTX PRO 6000 Blackwell GPU 총 6개 탑재)
- 헤드 노드 구성: ml.r5d.16xlarge 인스턴스 1대(512GB RAM 탑재, Ray GCS 및 LoRA 어댑터 통합 관리)
- 정책 모델: Fully Sharded Data Parallel(FSDP)로 6개 GPU에 샤딩된 Qwen3-VL-8B(LoRA rank 32)
- 롤아웃 엔진: 각 GPU마다 1개씩 독립 배치된 6개의 vLLM 인스턴스
- 공유 스토리지: Amazon FSx for Lustre(`/shared` 마운트), LoRA 어댑터 동기화 및 체크포인트 보관
```text trainer.placement.colocate_all=true gpu_memory_utilization=0.45 n_samples_per_prompt=8 max_turns=15 ```
위 설정에서 `gpu_memory_utilization`을 0.45로 보수적으로 지정하여 단일 GPU 내부에서 FSDP 샤드와 vLLM의 KV 캐시가 메모리를 충돌 없이 공유하도록 여유 공간을 확보했습니다. 매 옵티마이저 스텝 이후 업데이트된 LoRA 어댑터 가중치는 FSx for Lustre 공유 스토리지를 통해 vLLM 엔진으로 즉각 동기화됩니다.
HyperPod 자동 복원력과 훈련 벤치마크 결과
VisGym 지도 미세조정(SFT) 체크포인트에서 시작한 Qwen3-VL-8B 모델은 HyperPod 기반 GRPO 사후 훈련을 통해 고정된 64개 미로 평가 세트에서 탐색 성능이 대폭 상승했습니다.
| 모델 및 단계 | 평가 세트 미로 해결 성공률(Solve Rate) | 비고 |
|---|---|---|
| Qwen3-VL-8B (VisGym SFT 초기 상태) | 43.75% | 미로 이미지 파싱 및 기본 구조화 액션 구사 |
| Qwen3-VL-8B (HyperPod GRPO 사후 훈련 완료) | 95.00% 이상 | 15회 이동 제한 내 최적 경로 추론 및 탐색 |
HyperPod 클러스터의 상태 모니터링 기능은 노드 장애 발생 시 불량 노드를 자동으로 감지하여 교체하며, `ckpt_interval=20` 설정과 `resume_mode=latest` 옵션을 결합하여 전체 학습 재시작 없이 마지막 체크포인트 지점부터 훈련을 이어갈 수 있도록 지원합니다.
---
Qumulo Cloud Data Fabric을 통한 크로스 리전 분산 훈련
컴퓨팅 클러스터와 데이터가 지리적으로 분리된 환경에서는 원격 읽기 지연(Latency)이 GPU 연산 중단으로 이어지는 문제가 발생합니다. SageMaker HyperPod와 Cloud Native Qumulo(CNQ)의 결합은 단일 데이터 사본을 유지하면서도 원격 클러스터의 GPU 가동률을 극대화하는 분산 스토리지 아키텍처를 제시합니다.
"Pairing Amazon SageMaker HyperPod with CNQ delivers two measurable outcomes: single-Region training performance scaling independently of data storage size, and remote clusters training at optimal utilization without data orchestration."
검증 아키텍처는 미국 동부(오하이오, us-east-2) 리전에 단일 소스 원본 데이터를 보유한 허브(Hub) 클러스터를 두고, 60ms의 네트워크 왕복 지연이 존재하는 미국 서부(오레곤, us-west-2) 리전에 스포크(Spoke) 클러스터를 구성하여 VPC 피어링(VPC Peering)으로 연결했습니다.
NeuralCache 기반의 선제적 데이터 캐싱 메커니즘
Qumulo의 Cloud Data Fabric(CDF)은 허브의 파일시스템 메타데이터를 스포크로 즉시 복제하여 수 초 내에 전체 POSIX 네임스페이스를 탐색할 수 있도록 구성합니다. 핵심 구성 요소인 NeuralCache는 데이터 로더의 순차적인 4KB 블록 읽기 패턴을 실시간으로 학습하는 AI 모델을 내장하고 있습니다.
- 학습 초기(100~150 배치): NeuralCache가 액세스 패턴을 학습하는 웜업(Warmup) 단계로, 원격 지연이 일부 반영되어 초당 95~105 샘플 처리 및 80~90% GPU 가동률 기록
- 웜업 완료 후(150 배치 이후): 94~96%의 캐시 적중률(Hit Rate)을 달성하며 로컬 NVMe 스토리지에서 5ms 미만(최저 2~3ms)의 지연 시간으로 데이터를 공급
- 정상 상태 처리량: 허브와 동일한 초당 115~117 샘플 처리량을 달성하며 GPU 가동률 98~100% 수렴
분산 훈련 성능 비교 실증
10억 2천만(1.02B) 파라미터 규모의 LLaMA v3 모델과 C4 데이터셋(4,840만 개 시퀀스, 4,096 토큰 윈도우 패킹)을 사용하여 각 클러스터당 ml.p5.48xlarge 인스턴스 2대(총 16개 NVIDIA H100 GPU) 환경에서 분산 훈련을 비교 검증했습니다.
| 클러스터 환경 | 네트워크 RTT 지연 | 데이터 캐시 적중률 | 학습 처리량 (Samples/sec) | 정상 상태 GPU 가동률 |
|---|---|---|---|---|
| 허브 클러스터 (us-east-2, 로컬 데이터) | 0 ms | 해당 없음 (로컬) | 115 ~ 117 | 99% (네트워크 포화) |
| 스포크 클러스터 (us-west-2, 콜드 스타트) | 60 ms | 초기 학습 중 (0~150 배치) | 95 ~ 105 | 80 ~ 90% |
| 스포크 클러스터 (us-west-2, 웜업 완료) | 60 ms | 94 ~ 96% (로컬 NVMe) | 115 ~ 117 | 98 ~ 100% |
실증 결과 10,000 배치 이상의 대규모 훈련 작업에서 100~150 배치의 일회성 웜업 시간은 전체 실행 시간의 1% 미만(100,000 배치 이상에서는 0.1% 미만)에 불과하여 실질적인 연산 손실 없이 원격 데이터 학습이 가능함을 입증했습니다.
---
엔터프라이즈 AI 엔지니어링을 위한 시사점
이러한 기술적 접근은 현대 AI 플랫폼 엔지니어링에 다음과 같은 핵심 구조를 제시합니다.
첫째, 사후 훈련 및 RL 파이프라인에서 단일 GPU 메모리를 분할하여 vLLM 롤아웃과 FSDP 가중치 훈련을 동시 처리하는 코로케이션 기법은 유휴 인프라 비용을 대폭 절감시킵니다. 둘째, 장시간 소요되는 클러스터 연산에서 Kubernetes 오케스트레이션과 연계된 노드 단위 자동 헬스체크 및 체크포인트 복원 체계는 하드웨어 결함으로 인한 작업 유실을 방지합니다.
셋째, 대규모 데이터셋을 물리적으로 이동하거나 각 리전마다 중복 복제하지 않고도, 신경망 기반 선제적 캐싱(NeuralCache)과 POSIX 호환 데이터 패브릭을 구성함으로써 지리적으로 분산된 고성능 가속기 자원을 즉각 훈련에 투입할 수 있습니다.