피지컬 AI 개발 패러다임의 전환과 모델 팩토리의 등장
로봇 공학 및 자율주행차(AV)와 같이 현실 세계의 데이터를 물리적 행동으로 변환하는 피지컬 AI(Physical AI) 시스템은 단 한 번의 모델 학습으로 완성되지 않습니다. 피지컬 AI는 합성 데이터 생성, 인식 및 정책 모델 사후 학습(Post-training), 폐루프(Closed-loop) 시뮬레이션 평가로 이어지는 지속적인 파이프라인을 필수적으로 요구합니다. 새로운 현실 데이터 스트림을 지속해서 흡수하여 모델을 개선하는 순환 체계를 피지컬 AI 모델 팩토리(Physical AI Model Factory)라고 부릅니다.
- 실세계 데이터 수집 및 큐레이션
- Cosmos3-Super 합성 데이터 증강
- Cosmos3-Nano 정책 사후 학습
- 폐루프 시뮬레이션 평가 및 재유입
기존 인공지능 파이프라인은 합성 데이터 생성, 사후 학습, 시뮬레이션 평가 단계마다 별도의 GPU 풀을 프로비저닝하고 해제하는 방식을 주로 사용했습니다. 그러나 이러한 방식은 클러스터 재구성 및 대규모 데이터 이동 과정에서 막대한 유휴 비용을 발생시킵니다. 따라서 전체 순환 주기에서 비용을 결정짓는 핵심 지표는 단일 작업의 최고 처리량이 아니라, 예약된 GPU 시간당 유용한 파이프라인 진행률을 의미하는 GPU 유효 처리량(GPU goodput)입니다.
---
엔비디아 코스모스 3: 단일 토큰 스트림과 MoT 아키텍처
엔비디아(NVIDIA)가 오픈 리눅스 재단 OpenMDW-1.1 라이선스로 공개한 코스모스 3(Cosmos 3)는 옴니모달(Omnimodal) 월드 파운데이션 모델로서, 단일 트랜스포머 트렁크(Trunk)를 통해 비디오 생성, 액션 라벨링, 로봇 정책 배포를 모두 처리합니다.
코스모스 3를 정의하는 핵심 설계 요소는 다음과 같습니다.
- 단일 토큰 스트림(One token stream): 텍스트, 비전, 오디오, 콤팩트한 포즈 델타 및 그리퍼 상태 액션 벡터가 단일 시퀀스로 결합됩니다. 비전 트랜스포머(ViT)가 이미지 이해를 담당하고 고정된 Wan2.2 비디오 VAE가 픽셀 생성을 처리합니다. 텍스트와 시각 정보를 읽는 자기회귀(AR) 영역이 비디오·오디오·액션을 생성하는 확산 모델(DM) 영역보다 앞에 배치됩니다.
- 계층별 결합 전문가 구조(Mixture-of-Transformers, MoT): 각 레이어마다 다음 토큰을 예측하는 추론기(Reasoner)와 비디오/오디오/액션 노이즈를 제거하는 생성기(Generator)가 동시에 실행됩니다. 이중 스트림 어텐션을 통해 모든 레이어에서 생성이 추론기의 출력에 기반하도록 결합됩니다.
- 학습과 추론의 비대칭성(Asymmetric at inference): 학습 시에는 비디오를 픽셀로 복원하는 완전한 디노이징 과정을 거치지만, 실제 로봇 배포 환경에서는 적은 수의 디노이징 스텝만 수행하고 비디오 디코딩을 건너뛰어 액션 토큰만 추출함으로써 연산 효율을 극대화합니다.
코스모스 3의 3가지 동작 모드와 모델 티어
코스모스 3는 노이즈 상태로 시작하는 토큰의 종류에 따라 세 가지 모드로 전환됩니다.
| 동작 모드 | 깨끗한 입력 토큰 | 노이즈(생성 대상) 토큰 | 주요 활용 목적 |
|---|---|---|---|
| 순방향 동역학 (Forward Dynamics) | 현재 프레임, 액션 | 미래 비디오 | 롱테일 주행 장면 및 희귀 조작 상호작용 합성 데이터 생성 |
| 역방향 동역학 (Inverse Dynamics) | 전후 비디오 프레임 | 유발 액션 | 라벨이 없는 원시 비디오를 액션 라벨링 데이터로 변환 |
| 정책 (Policy) | 첫 프레임, 고유 수용성 감각 | 미래 액션 (32스텝 지평) | 로봇 및 자율주행 하드웨어에 직접 배포되어 제어 명령 출력 |
모델 제품군은 8B Qwen3-VL 백본 기반의 Cosmos3-Nano(16B), 32B Qwen3-VL 백본 기반의 Cosmos3-Super(64B), 그리고 온디바이스 배포를 위해 2B 백본 기반으로 처음부터 학습된 Cosmos3-Edge(4B)로 구성됩니다.
---
SageMaker HyperPod와 공유 스토리지 기반의 단일 풀 운영
피지컬 AI 모델 팩토리의 네 가지 단계를 매끄럽게 연결하기 위해서는 일관된 제어 평면을 가진 단일 GPU 풀이 요구됩니다. 아마존 EKS(Amazon EKS) 기반의 아마존 세이지메이커 하이퍼팟(Amazon SageMaker HyperPod)은 이와 같은 연속적 파이프라인 수요에 부합하는 인프라 환경을 제공합니다.
"좋은 처리량(Goodput)은 각 단계가 단일 풀을 공유할 때 가장 높아지며, 별도의 클러스터 간 재프로비저닝이나 데이터 마이그레이션으로 낭비되는 GPU 시간을 제거합니다."
하이퍼팟 환경에서 코스모스 3 워크로드는 다음과 같이 단일 클러스터 내에서 시간 공유(Time-shared) 방식으로 오케스트레이션됩니다.
- 통합 스토리지 레이어: Amazon S3 버킷과 데이터 저장소 연결(DRA)로 동기화되는 Amazon FSx for Lustre 파일 시스템이 Elastic Fabric Adapter(EFA)를 통해 마운트됩니다. 생성 단계가 합성 클립을 작성하면, 사후 학습 단계가 이를 즉시 읽고, 정책 서버가 체크포인트를 동일 볼륨에서 불러옵니다.
- 통합 제어 평면 워크로드: 합성 데이터 생성은 vLLM-Omni 서버에서 실행되고, 사후 학습은 FSDP2와 Ulysses 컨텍스트 병렬 처리를 적용한 torchrun(cosmos-framework) 기반으로 수행되며, 평가는 단일 GPU 정책 서버에서 동작합니다.
- 자동 복구 및 회복 탄력성: 하이퍼팟은 결함이 발생한 노드를 지속적으로 감지하여 자동으로 재부팅하거나 교체합니다. Kubeflow PyTorchJob은 장애 발생 시 포드 갱(Gang)을 재생성하고 NCCL 통신을 복구하여 중단 없는 학습을 보장합니다.
---
HyperPod InstantStart를 통한 에이전트 기반 인프라 운영
파운데이션 모델 인프라 구축은 네트워크 생성, 가속기 용량 연결, 스토리지 구성, 하드웨어 장애 대응 등 복잡한 단계적 종속성을 가집니다. AWS가 오픈소스로 공개한 하이퍼팟 인스턴트스타트(HyperPod InstantStart)는 이러한 인프라 구성 문제를 해결하는 독립 관리형 컨트롤 플레인입니다.
인스턴트스타트는 웹 UI, REST API, 그리고 AI 에이전트가 사용하는 모델 컨텍스트 프로토콜(MCP) 도구를 동일한 백엔드 컨테이너 내에서 제공합니다. Kiro CLI 기반의 AI 에이전트는 자연어 대화 한 줄로 다단계 클러스터 프로비저닝을 자동으로 수행합니다.
``` [인프라 엔지니어 / AI 에이전트 (Kiro CLI)] │ (REST API / MCP Tool Call) ▼ [InstantStart 관리 컨테이너 (Port 3099)] ├── EKS 제어 평면 (8~12분 소요, 독립 재시도 가능) ├── 가속기 인스턴스 그룹 (Deep Health Checks, EFA 설정) └── 네트워크 자동화 (AZ별 /20 연산 서브넷 자동 프로비저닝) ```
에이전트는 원시 CLI를 직접 실행하는 대신 유효성 검증 규칙이 내장된 컨트롤 플레인 API를 호출합니다. 에이전트는 클러스터 태그, 가용 영역(AZ), 인스턴스 유형, 용량 유형과 같은 핵심 결정 사항만 사용자에게 질의하며, 서브넷 CIDR 계산이나 라우팅 테이블 연결과 같은 세부 작업은 `ensureComputeSubnet()` 함수를 통해 완전히 자동화합니다.
---
대규모 AI 클러스터의 용량 관리와 자율 복구 체계
하이퍼팟 인스턴트스타트는 대규모 가속기 플릿을 안정적으로 운영하기 위해 생성 시점부터 탄력성과 거버넌스 규칙을 강제합니다.
- 심층 상태 점검(Deep Health Checks): 노드가 작업을 수락하기 전에 GPU 및 EFA 연결 상태에 대한 스트레스 테스트를 수행하며, 점검 결과는 쿠버네티스 레이블, 테인트(Taint), 어노테이션으로 투영됩니다.
- 격리된 대규모 네트워크 레이아웃: EKS 제어 평면 서브넷과 대규모 가속기 플릿을 위한 하이퍼팟 연산 서브넷을 분리하며, 연산 서브넷은 /20 크기로 생성되어 IP 고갈을 방지합니다.
- 관리형 카펜터(Managed Karpenter) 자동 확장: AWS가 카펜터 컨트롤러를 직접 운영하며, 0개 노드 상태에서 수요에 따라 하이퍼팟 인스턴스 그룹을 동적으로 스케일업 및 스케일다운합니다.
- 불변 설정 정규화: `OnStartDeepHealthChecks`, `NetworkInterface`(EFA 전용 모드)와 같은 불변(Immutable) 설정 필드를 허용 목록(Allowlist)을 통해 유지함으로써 스케일링 중 설정이 유실되는 현상을 방지합니다.
이러한 구조적 통합을 통해 기업은 인프라 오버헤드를 대폭 줄이고, 피지컬 AI와 대형 파운데이션 모델 개발 전반의 생산성을 극대화할 수 있습니다.