피지컬 AI 팩토리와 하이퍼팟 자동화

피지컬 AI(Physical AI)와 파운데이션 모델 개발이 단일 학습 작업을 넘어 지속적인 데이터 생성·학습·평가의 '모델 팩토리' 체제로 진화하고 있습니다. 엔비디아 코스모스 3(Cosmos 3)는 단일 토큰 스트림 및 MoT 아키텍처를 통해 데이터 합성부터 로봇 정책 배포까지 하나의 백본으로 통합했습니다. AWS는 아마존 세이지메이커 하이퍼팟(Amazon SageMaker HyperPod)과 오픈소스 컨트롤 플레인 '인스턴트스타트(InstantStart)'를 결합하여 복잡한 인프라 오케스트레이션을 AI 에이전트 기반으로 자동화하고 GPU 유효 처리량(goodput)을 극대화하는 방안을 제시했습니다.

피지컬 AI 개발 패러다임의 전환과 모델 팩토리의 등장

로봇 공학 및 자율주행차(AV)와 같이 현실 세계의 데이터를 물리적 행동으로 변환하는 피지컬 AI(Physical AI) 시스템은 단 한 번의 모델 학습으로 완성되지 않습니다. 피지컬 AI는 합성 데이터 생성, 인식 및 정책 모델 사후 학습(Post-training), 폐루프(Closed-loop) 시뮬레이션 평가로 이어지는 지속적인 파이프라인을 필수적으로 요구합니다. 새로운 현실 데이터 스트림을 지속해서 흡수하여 모델을 개선하는 순환 체계를 피지컬 AI 모델 팩토리(Physical AI Model Factory)라고 부릅니다.

  1. 실세계 데이터 수집 및 큐레이션
  2. Cosmos3-Super 합성 데이터 증강
  3. Cosmos3-Nano 정책 사후 학습
  4. 폐루프 시뮬레이션 평가 및 재유입

기존 인공지능 파이프라인은 합성 데이터 생성, 사후 학습, 시뮬레이션 평가 단계마다 별도의 GPU 풀을 프로비저닝하고 해제하는 방식을 주로 사용했습니다. 그러나 이러한 방식은 클러스터 재구성 및 대규모 데이터 이동 과정에서 막대한 유휴 비용을 발생시킵니다. 따라서 전체 순환 주기에서 비용을 결정짓는 핵심 지표는 단일 작업의 최고 처리량이 아니라, 예약된 GPU 시간당 유용한 파이프라인 진행률을 의미하는 GPU 유효 처리량(GPU goodput)입니다.

---

엔비디아 코스모스 3: 단일 토큰 스트림과 MoT 아키텍처

엔비디아(NVIDIA)가 오픈 리눅스 재단 OpenMDW-1.1 라이선스로 공개한 코스모스 3(Cosmos 3)는 옴니모달(Omnimodal) 월드 파운데이션 모델로서, 단일 트랜스포머 트렁크(Trunk)를 통해 비디오 생성, 액션 라벨링, 로봇 정책 배포를 모두 처리합니다.

코스모스 3를 정의하는 핵심 설계 요소는 다음과 같습니다.

코스모스 3의 3가지 동작 모드와 모델 티어

코스모스 3는 노이즈 상태로 시작하는 토큰의 종류에 따라 세 가지 모드로 전환됩니다.

동작 모드깨끗한 입력 토큰노이즈(생성 대상) 토큰주요 활용 목적
순방향 동역학 (Forward Dynamics)현재 프레임, 액션미래 비디오롱테일 주행 장면 및 희귀 조작 상호작용 합성 데이터 생성
역방향 동역학 (Inverse Dynamics)전후 비디오 프레임유발 액션라벨이 없는 원시 비디오를 액션 라벨링 데이터로 변환
정책 (Policy)첫 프레임, 고유 수용성 감각미래 액션 (32스텝 지평)로봇 및 자율주행 하드웨어에 직접 배포되어 제어 명령 출력

모델 제품군은 8B Qwen3-VL 백본 기반의 Cosmos3-Nano(16B), 32B Qwen3-VL 백본 기반의 Cosmos3-Super(64B), 그리고 온디바이스 배포를 위해 2B 백본 기반으로 처음부터 학습된 Cosmos3-Edge(4B)로 구성됩니다.

---

SageMaker HyperPod와 공유 스토리지 기반의 단일 풀 운영

피지컬 AI 모델 팩토리의 네 가지 단계를 매끄럽게 연결하기 위해서는 일관된 제어 평면을 가진 단일 GPU 풀이 요구됩니다. 아마존 EKS(Amazon EKS) 기반의 아마존 세이지메이커 하이퍼팟(Amazon SageMaker HyperPod)은 이와 같은 연속적 파이프라인 수요에 부합하는 인프라 환경을 제공합니다.

"좋은 처리량(Goodput)은 각 단계가 단일 풀을 공유할 때 가장 높아지며, 별도의 클러스터 간 재프로비저닝이나 데이터 마이그레이션으로 낭비되는 GPU 시간을 제거합니다."

하이퍼팟 환경에서 코스모스 3 워크로드는 다음과 같이 단일 클러스터 내에서 시간 공유(Time-shared) 방식으로 오케스트레이션됩니다.

---

HyperPod InstantStart를 통한 에이전트 기반 인프라 운영

파운데이션 모델 인프라 구축은 네트워크 생성, 가속기 용량 연결, 스토리지 구성, 하드웨어 장애 대응 등 복잡한 단계적 종속성을 가집니다. AWS가 오픈소스로 공개한 하이퍼팟 인스턴트스타트(HyperPod InstantStart)는 이러한 인프라 구성 문제를 해결하는 독립 관리형 컨트롤 플레인입니다.

인스턴트스타트는 웹 UI, REST API, 그리고 AI 에이전트가 사용하는 모델 컨텍스트 프로토콜(MCP) 도구를 동일한 백엔드 컨테이너 내에서 제공합니다. Kiro CLI 기반의 AI 에이전트는 자연어 대화 한 줄로 다단계 클러스터 프로비저닝을 자동으로 수행합니다.

``` [인프라 엔지니어 / AI 에이전트 (Kiro CLI)] │ (REST API / MCP Tool Call) ▼ [InstantStart 관리 컨테이너 (Port 3099)] ├── EKS 제어 평면 (8~12분 소요, 독립 재시도 가능) ├── 가속기 인스턴스 그룹 (Deep Health Checks, EFA 설정) └── 네트워크 자동화 (AZ별 /20 연산 서브넷 자동 프로비저닝) ```

에이전트는 원시 CLI를 직접 실행하는 대신 유효성 검증 규칙이 내장된 컨트롤 플레인 API를 호출합니다. 에이전트는 클러스터 태그, 가용 영역(AZ), 인스턴스 유형, 용량 유형과 같은 핵심 결정 사항만 사용자에게 질의하며, 서브넷 CIDR 계산이나 라우팅 테이블 연결과 같은 세부 작업은 `ensureComputeSubnet()` 함수를 통해 완전히 자동화합니다.

---

대규모 AI 클러스터의 용량 관리와 자율 복구 체계

하이퍼팟 인스턴트스타트는 대규모 가속기 플릿을 안정적으로 운영하기 위해 생성 시점부터 탄력성과 거버넌스 규칙을 강제합니다.

이러한 구조적 통합을 통해 기업은 인프라 오버헤드를 대폭 줄이고, 피지컬 AI와 대형 파운데이션 모델 개발 전반의 생산성을 극대화할 수 있습니다.

Cifras verificadas

Nuestra opinión

피지컬 AI의 성패는 단발성 모델 학습 성능이 아니라 데이터와 정책이 끊김 없이 순환하는 인프라 자동화 수준에 달려 있습니다. 코스모스 3와 같은 옴니모달 아키텍처와 하이퍼팟 인스턴트스타트의 결합은 고비용 가속기 클러스터의 운영 장벽을 대폭 낮추는 표준 설계가 될 것입니다.

Preguntas abiertas

Fuente

Volver al catálogo