AI 에이전트와 분산 학습의 새로운 인프라 병목 과제
대규모 언어 모델(LLM)과 비전-언어 모델(VLM)이 단순 질의응답을 넘어 복잡한 환경에서 연속적으로 판단하고 행동하는 '에이전트' 단계로 진화하면서, 사후 학습(Post-training) 단계의 핵심으로 강화학습(Reinforcement Learning, RL)이 급부상하고 있습니다. 에이전트형 모델은 일련의 궤적(Trajectories)을 생성하고, 환경으로부터 보상을 수신하며, 결과에 기반해 정책을 갱신하는 다단계(Multi-turn) 탐색을 수행합니다. 이 과정은 수백 GPU-시간 규모의 롤아웃(Rollout) 연산과 고도의 분산 인프라를 요구합니다.
동시에 글로벌 AI 개발 현장에서는 인프라 가용성과 데이터 거버넌스의 불일치라는 또 다른 물리적 장벽에 직면해 있습니다. 최첨단 모델 학습을 위한 대규모 GPU 클러스터가 위치한 리전과 실제 페타바이트급 학습 데이터셋이 저장된 리전이 서로 다를 경우, 크로스 리전 네트워크 지연(Latency)과 데이터 전송 비용으로 인해 GPU가 데이터 로딩을 기다리며 유휴 상태에 빠지는 현상이 발생합니다.
Amazon Web Services(AWS)는 이러한 AI 인프라의 양대 병목을 해결하기 위해 Amazon SageMaker HyperPod를 중심으로 한 두 가지 최적화 파이프라인 실증 결과를 발표했습니다. 하나는 오픈소스 강화학습 프레임워크인 SkyRL과 GRPO(Group Relative Policy Optimization)를 결합한 멀티모달 RL 학습 최적화이며, 다른 하나는 Cloud Native Qumulo(CNQ) 및 CDF(Cloud Data Fabric)를 활용한 무복제(Zero-copy) 멀티 리전 분산 학습 아키텍처입니다.
---
멀티모달 에이전트를 위한 SkyRL과 GRPO 분산 아키텍처
전통적인 단일 턴(Single-turn) RL은 모델의 단일 출력에 즉각 보상을 부여하지만, 2D 미로 찾기와 같은 순차적 환경을 탐색하는 멀티 턴 RL은 에피소드 전체에 걸쳐 누적된 보상을 통해 정책을 학습합니다. 목표 지점에 도달했을 때만 1.0의 보상이 주어지는 희소 보상(Sparse reward) 환경에서는 개별 스텝에 대한 정답 레이블이 존재하지 않으므로, 정책 최적화 알고리즘의 효율성이 성능을 결정짓습니다.
AWS 연구진은 별도의 비평가(Critic)나 가치 모델(Value model) 없이도 동작하는 GRPO 알고리즘을 채택했습니다. 에이전트가 동일한 시작 위치에서 여러 경로를 생성하면, GRPO는 해당 그룹 내 실행 결과들을 상호 비교하여 그룹 평균을 상회하는 궤적을 강화하고 뒤처지는 궤적을 억제하는 방식으로 정책을 갱신합니다.
- 환경 관측 및 이미지 입력
- vLLM 롤아웃 궤적 생성
- GRPO 그룹 상대 비교
- FSDP 정책 모델 가중치 갱신
- FSx for Lustre 어댑터 동기화
이 과정에서 연산 자원의 낭비를 막기 위해 학습(Training)과 추론(Rollout) 엔진을 동일 GPU에 공존시키는 Colocation 구조가 적용되었습니다.
- 동일 GPU 상의 작업 분할: `trainer.placement.colocate_all=true` 설정을 통해 롤아웃 단계에서는 vLLM 인스턴스가 병렬 추론을 수행하고, 정책 갱신 단계에서는 PyTorch FSDP(Fully Sharded Data Parallel)가 집합 학습을 수행합니다.
- 핑퐁 대기 시간 제거: 학습 전용 노드 풀과 추론 전용 노드 풀을 분리할 때 발생하는 상호 유휴 시간(Idle time)을 없애고 하드웨어 가동률을 극대화했습니다.
- 메모리 헤드룸 제어: GPU당 FSDP 샤드와 vLLM KV 캐시가 공존할 수 있도록 `gpu_memory_utilization=0.45`로 보수적으로 할당했습니다.
- FSx for Lustre 기반 고속 동기화: 옵티마이저 스텝이 완료될 때마다 갱신된 LoRA(Low-Rank Adaptation, rank 32) 어댑터 가중치가 `/shared` 공유 스토리지를 통해 추론 엔진에 즉시 반영됩니다.
| 구성 요소 | 할당 인스턴스 및 사양 | 세부 역할 |
|---|---|---|
| 워커 노드 (Worker) | 3x ml.g7e.12xlarge (총 6x NVIDIA RTX PRO 6000 Blackwell GPU) | FSDP 정책 모델 샤딩 및 6개 vLLM 롤아웃 엔진 병렬 실행 |
| 헤드 노드 (Head) | 1x ml.r5d.16xlarge (512 GB RAM) | Ray GCS 관리, 대시보드 호스팅, 체크포인트 저장 시 LoRA 샤드 CPU 메모리 병합 |
| 공유 스토리지 | Amazon FSx for Lustre (ReadWriteMany PVC) | 체크포인트, LoRA 가중치 동기화, 평가 데이터 공유 |
"GRPO post-training on HyperPod improves the maze solve rate from 43.75% to more than 95% on a fixed 64-maze evaluation set."
Qwen3-VL-8B 모델을 기반으로 VisGym SFT 체크포인트에서 출발한 GRPO 사후 학습은 고정된 64개 미로 평가 셋에서 탐색 성공률을 초기 43.75%에서 95% 이상으로 대폭 향상시켰습니다. 또한 SageMaker HyperPod의 자동 노드 복구 기능과 20스텝 주기 체크포인팅(`ckpt_interval=20`)을 결합하여, 하드웨어 장애 발생 시에도 처음부터 다시 시작하지 않고 직전 스텝부터 즉각 재개할 수 있는 탄력성을 확보했습니다.
---
멀티 리전 분산 학습의 데이터 병목을 해결하는 Qumulo Cloud Data Fabric
대규모 모델 학습 시 컴퓨팅 자원(GPU)과 데이터셋이 서로 다른 리전에 존재할 때, 수 페타바이트의 데이터를 물리적으로 복제하는 것은 엄청난 비용과 동기화 지연을 유발합니다. SageMaker HyperPod와 Cloud Native Qumulo(CNQ)의 결합은 원격 리전 간에 데이터를 사전에 복제하지 않고도 단일 리전 수준의 I/O 성능을 유지하는 Zero-copy 아키텍처를 제시합니다.
실증 테스트는 허브 클러스터(미국 동부 오하이오 `us-east-2`, 데이터 원본 위치)와 스포크 클러스터(미국 서부 오레곤 `us-west-2`, 원격 연산) 사이에서 진행되었습니다. 두 리전은 60ms의 네트워크 왕복 지연을 가진 VPC 피어링으로 연결되었습니다.
| Hub 단일 리전 (us-east-2) | 116 |
| Spoke 웜업 초기 (0-150 배치) | 100 |
| Spoke 수렴 후 (150+ 배치) | 116 |
이 아키텍처의 핵심 메커니즘은 다음과 같습니다.
- 단일 원천 데이터(Single Source of Truth): 원본 데이터셋(C4 데이터셋, 48.4M 시퀀스, 4,096 토큰 윈도우)을 허브 리전의 CNQ에만 저장하고, 스포크 리전은 NFS를 통해 동일한 통합 POSIX 네임스페이스를 마운트합니다.
- NeuralCache 기반 예측 프리페칭: Qumulo CDF 내부의 NeuralCache 모델이 데이터 로더의 순차적 4KB 블록 읽기 패턴을 실시간으로 학습합니다. 요청이 발생하기 전에 필요한 블록을 예측하여 원격 허브로부터 스포크 노드의 로컬 NVMe 캐시로 사전 인출합니다.
- 지연 시간 은폐 및 혼잡 제어: 초기 100~150개 배치 동안 캐시를 학습(Warmup)한 이후, 데이터 읽기의 94~96%가 로컬 NVMe 캐시에서 5ms 미만의 레이턴시로 처리됩니다. 패킷 손실이 아닌 대역폭과 왕복 지연 시간에 맞춰 전송률을 조절하는 고급 혼잡 제어를 통해 최대 900ms RTT 환경에서도 회선 한계치에 가까운 처리량을 지속 공급합니다.
| 평가 항목 | 허브 단일 리전 (us-east-2) | 스포크 콜드 스타트 (0~150 배치) | 스포크 웜업 완료 (150+ 배치) |
|---|---|---|---|
| 학습 처리량 (Samples/sec) | 115 ~ 117 | 95 ~ 105 (일시적 지연 노출) | 115 ~ 117 (허브와 동일 수준 수렴) |
| GPU 평균 가동률 (%) | 98 ~ 100% | 80 ~ 90% | 98 ~ 100% (최대 99% 이상) |
| 스토리지 읽기 레이턴시 | 2 ~ 3 ms (최대치) | 원격 네트워크 지연 영향 | 서브 5 ms (로컬 NVMe 히트) |
10.2억 파라미터(1.02B)의 LLaMA v3 모델을 16대의 H100 GPU(클러스터당 2x `ml.p5.48xlarge`)로 학습한 결과, 원격 스포크 클러스터는 150배치 이후 허브와 동일한 115~117 samples/sec 처리량과 98~100%의 GPU 가동률에 도달했습니다. 10만 배치 이상의 대규모 학습 작업에서 150배치의 초기 웜업 시간은 전체 수행 시간의 0.1% 미만에 불과하여 연산 손실이 사실상 무시할 수 있는 수준임이 입증되었습니다.
---
엔터프라이즈 AI 인프라의 패러다임 전환과 시사점
이번 AWS의 실증 결과들은 대규모 모델의 사후 학습과 인프라 운영 방식에 중대한 전환점을 시사합니다.
첫째, 멀티모달 RL 파이프라인에서 연산과 메모리 배치의 고도화입니다. SkyRL과 GRPO, 그리고 vLLM-FSDP Colocation의 결합은 강화학습이 요구하는 막대한 추론 및 정책 학습 연산을 단일 인프라 풀 안에서 유휴 시간 없이 흡수할 수 있음을 보여주었습니다. 특히 별도의 크리틱 모델을 제거하여 VRAM 점유를 최소화하면서 시각 미로 탐색 성공률을 2배 이상 끌어올린 점은, 향후 로보틱스, GUI 에이전트, 자율주행 등 복잡한 환경 상호작용 모델의 학습 비용을 획기적으로 낮출 수 있는 설계 경로를 제공합니다.
둘째, 글로벌 분산 AI 인프라에서 '데이터 중심'에서 '컴퓨트 유연성 중심'으로의 운영 전환입니다. 데이터셋 복제 없이 원격 리전의 가용 GPU 클러스터를 즉시 투입할 수 있게 됨에 따라, 특정 리전의 가속기 품귀 현상에 구애받지 않고 글로벌 인프라 자원을 유연하게 배분할 수 있습니다. 이는 엔터프라이즈가 직면한 스토리지 이중화 비용과 데이터 동기화 리스크를 제거하면서도 최상위 GPU 자원의 가동률을 99% 수준으로 유지할 수 있는 현실적인 해법을 제시합니다.