피지컬 AI 팩토리와 지능형 인프라 오케스트레이션의 결합

엔비디아 코스모스 3(Cosmos 3)와 아마존 세이지메이커 하이퍼팟(Amazon SageMaker HyperPod)이 결합하여 로봇 및 자율주행을 위한 지속 가능한 '피지컬 AI 모델 팩토리' 아키텍처를 제시했습니다. 코스모스 3는 트랜스포머 혼합(MoT) 설계를 바탕으로 단일 가중치 제품군 내에서 합성 데이터 생성, 행동 라벨링, 정책 배포의 세 가지 모드를 유연하게 전환합니다. 여기에 에이전트 기반 인프라 제어 평면인 '인스턴트스타트(InstantStart)'가 더해져 클러스터 구성부터 장애 복구까지 인프라 전 과정을 자동화함으로써 유효 연산 효율(GPU Goodput)을 극대화합니다.

피지컬 AI 개발의 패러다임 전환: 단일 학습에서 지속적 모델 팩토리로

로봇 공학 및 자율주행 차량과 같이 물리적 현실 세계와 상호작용하는 피지컬 AI(Physical AI) 시스템은 일회성 모델 학습 작업으로 완성될 수 없습니다. 실제 환경에서 발생하는 새로운 엣지 케이스 데이터를 지속적으로 수집하고, 이를 기반으로 합성 데이터를 증강하며, 정책(Policy) 모델을 사후 학습(Post-training)시킨 뒤 시뮬레이션에서 검증하는 순환 주기가 필수적입니다.

  1. 실세계 데이터 수집 및 정제
  2. 초거대 월드 모델 기반 합성 데이터 증강
  3. 경량 정책 모델 분산 사후 학습
  4. 폐루프 시뮬레이션 평가 및 피드백

이러한 피지컬 AI 모델 팩토리(Physical AI Model Factory)의 가동에는 막대한 컴퓨팅 자원이 요구됩니다. 기존 방식에서는 데이터 합성용 노드, 사후 학습용 노드, 시뮬레이션 평가용 노드를 각각 별도로 프로비저닝하고 해체하는 과정을 반복하면서 심각한 자원 파편화와 대기 시간 손실이 발생했습니다. 이제 업계는 단일화된 파운데이션 모델 아키텍처와 이를 뒷받침하는 자동화된 인프라 제어 평면을 통해 GPU 굿풋(GPU Goodput, 예약된 GPU 시간당 유효 파이프라인 진행률)을 극대화하는 방향으로 선회하고 있습니다.

---

엔비디아 코스모스 3: 세 가지 역할을 수행하는 옴니모달 월드 파운데이션 모델

엔비디아는 리눅스 재단(Linux Foundation)의 OpenMDW-1.1 라이선스로 개방형 옴니모달 월드 파운데이션 모델인 엔비디아 코스모스 3(NVIDIA Cosmos 3)를 공개했습니다. 코스모스 3는 비디오, 이미지, 행동(Action), 음향 신호를 단일 토큰 스트림으로 통합 처리하며, 독창적인 트랜스포머 혼합(Mixture-of-Transformers, MoT) 아키텍처를 채택했습니다.

``` Cosmos 3 아키텍처의 핵심 3대 설계 원칙:

```

코스모스 3는 어떤 토큰을 노이즈 상태로 시작하느냐에 따라 3가지 구체적인 액션 모드를 지원합니다.

모델 티어파라미터 수백본(Backbone) 구조주요 목표 워크로드
Cosmos3-Super64B32B Qwen3-VL 기반대규모 합성 데이터 생성 엔진
Cosmos3-Nano16B8B Qwen3-VL 기반DROID 등 실기 로봇 정책 학습
Cosmos3-Edge4B자체 사전학습 ~2B 고밀도 백본Jetson Thor / Orin 온디바이스 배포

이러한 구조적 통합 덕분에 데이터 생성, 사후 학습, 평가 작업이 단일 모델 계열 내에서 시분할 방식으로 스케줄링될 수 있습니다.

---

세이지메이커 하이퍼팟 기반의 통합 스토리지 및 분산 학습 인프라

코스모스 3의 단일 토큰 스트림 및 64B 규모 MoT 구조를 실행하기 위해서는 고대역폭·저지연 상호 연결과 공유 스토리지 계층이 필수적입니다. AWS는 아마존 세이지메이커 하이퍼팟(Amazon SageMaker HyperPod)과 Amazon EKS를 기반으로 전 주기를 단일 클러스터 풀로 묶어내는 아키텍처를 구현했습니다.

"데이터가 새로 도착할 때마다 파이프라인의 각 단계가 멈추지 않고 다시 실행되어야 합니다. 이러한 환경에서의 핵심 비용 결정 요인은 개별 작업의 최대 처리량이 아니라, 예약된 GPU 시간당 실질적 작업 진척도를 의미하는 GPU 굿풋(GPU goodput)입니다."

하이퍼팟 환경에서는 Elastic Fabric Adapter(EFA)로 연결된 Amazon FSx for Lustre 파일 시스템이 Amazon S3 버킷과 데이터 리포지토리 연결(DRA)로 직접 동기화됩니다. 이를 통해 생성 서버(vLLM-Omni)가 합성한 비디오 클립을 파일 시스템에 기록하면, `torchrun` 기반의 분산 사후 학습(FSDP2 및 Ulysses 컨텍스트 병렬 처리) 워크로드가 데이터 마이그레이션 없이 동일한 볼륨 경로에서 즉시 데이터를 읽어 들여 학습을 수행합니다. 검증된 체크포인트는 단일 GPU 정책 서버로 곧바로 로드되어 시뮬레이션 평가를 거칩니다.

---

하이퍼팟 인스턴트스타트: 에이전트 기반 인프라 자동화와 탄력적 복구 체계

대규모 분산 클러스터를 운영할 때 발생하는 가장 큰 병목은 네트워크, 스토리지, 컴퓨팅 제어 평면 간의 의존성 관리 및 하드웨어 장애 대응입니다. AWS가 공개한 오픈소스 제어 평면 하이퍼팟 인스턴트스타트(HyperPod InstantStart)는 이러한 복잡한 구성을 에이전트 기반으로 자동화합니다.

인스턴트스타트는 웹 UI, REST API, 그리고 AI 에이전트용 모델 컨텍스트 프로토콜(MCP) 도구를 단일 백엔드 컨테이너로 제공합니다. 이를 통해 터미널 환경에서 자연어 한 문장으로 완전한 클러스터 프로비저닝을 수행할 수 있습니다.

``` InstantStart 오케스트레이션 단계 및 제어 규칙: 1. EKS 제어 평면 생성 (약 8~12분 소요, 독립적 재시도 가능) 2. 네트워크 계층 분리: EKS 서브넷과 대규모 가속기 플릿을 위한 /20 CIDR 연산 전용 서브넷 자동 분리 생성 3. 하이퍼팟 클러스터 의존성 조정 및 Amazon FSx for Lustre 스토리지 자동 마운트 4. AI 에이전트(hypd-inst-agent)의 완료 상태 지속 폴링: 요청 제출 단계에서 멈추지 않고 검증 완료 상태까지 자동 추적 ```

또한 인스턴트스타트는 하드웨어 장애 시 워크로드가 중단되지 않도록 심층 헬스체크(Deep Health Checks)를 지원합니다. 인스턴스가 작업을 수락하기 전 GPU 및 EFA 연결성에 대한 스트레스 테스트를 먼저 거치며, 장애 감지 시 노드를 자동으로 재부팅하거나 교체합니다. 장애 정보는 쿠버네티스의 레이블, 테인트(Taints), 어노테이션으로 투영되어 스케줄러가 결함 노드를 즉각 회피하도록 설계되었습니다.

이와 더불어 AWS가 관리하는 카펜터(Karpenter) 기반 노드 오토스케일링과 유연한 훈련 계획(Flexible Training Plan)을 결합함으로써, 피지컬 AI 개발 팀은 노드 관리 오버헤드를 최소화하고 지속적인 파이프라인 구동에만 집중할 수 있게 되었습니다.

확인된 수치

우리 관점

피지컬 AI의 성패는 단일 알고리즘의 우수성을 넘어 데이터 수집, 합성 생성, 정책 학습, 시뮬레이션 평가가 중단 없이 맞물리는 파이프라인 자동화 수준에 달려 있습니다. 코스모스 3와 같은 멀티모달 통합 모델과 하이퍼팟 인스턴트스타트 같은 지능형 인프라 오케스트레이션의 결합은 로보틱스 엔지니어링의 진입 장벽을 대폭 낮출 것으로 전망됩니다.

아직 확인되지 않은 것

출처

카탈로그로