피지컬 AI 팩토리와 에이전트 기반 인프라 자동화 구축

엔비디아 Cosmos 3는 비디오·이미지·행동·음향을 단일 토큰 스트림으로 처리하는 옴니모달 세계 기반 모델로, 단일 트렁크에서 합성 데이터 생성, 역역학 라벨링, 정책 배포의 3가지 모드를 모두 수행합니다. AWS는 Amazon SageMaker HyperPod와 Amazon EKS 환경에서 이 모델을 운영하는 '피지컬 AI 모델 팩토리' 아키텍처와 오픈소스 제어 플레인 'HyperPod InstantStart'를 발표했습니다. HyperPod InstantStart는 웹 UI 및 Model Context Protocol(MCP) 기반 AI 에이전트를 통해 클러스터 부트스트랩, 스토리지 마운트, Karpenter 오토스케일링, 장애 자동 복구를 단일 진입점으로 통합합니다. 이를 통해 파편화된 GPU 인프라를 하나의 풀로 시분할 공유하여 GPU 유효 처리량(goodput)을 극대화할 수 있습니다.

피지컬 AI의 확장 병목과 통합 모델의 필요성

로봇과 자율주행차(AV) 등 현실 세계의 데이터를 물리적 행동으로 변환하는 피지컬 AI(Physical AI) 시스템은 단일 학습 작업으로 완성되지 않습니다. 합성 데이터 생성, 인식 및 정책 모델 사후 학습, 폐루프(closed-loop) 시뮬레이션 평가로 이어지는 지속적인 파이프라인 루프가 필수적입니다. 종전의 파이프라인은 각 단계마다 별도의 GPU 풀을 프로비저닝해야 했으며, 이는 GPU 유효 처리량(goodput, 예약된 GPU 시간당 유용한 파이프라인 진행률) 저하와 리소스 파편화를 유발했습니다.

엔비디아(NVIDIA)가 Linux Foundation OpenMDW-1.1 라이선스로 공개한 Cosmos 3는 이러한 파편화를 단일 모델 패밀리로 해소합니다. Cosmos 3는 비디오, 이미지, 행동, 음향을 단일 시퀀스로 취급하는 옴니모달 세계 기반 모델(world foundation model)입니다.

  1. 실세계 데이터 수집 및 선별
  2. Cosmos3-Super 합성 데이터 생성
  3. Cosmos3-Nano 정책 사후 학습
  4. 폐루프 시뮬레이션 평가 및 실패 사례 피드백

Cosmos 3의 핵심 아키텍처: MoT 및 3가지 작동 모드

Cosmos 3는 비전-언어 모델(VLM)에 확산 트랜스포머(DiT)를 단순 결합하는 기존 방식을 탈피하여, 모든 계층에서 결합되는 Mixture-of-Transformers (MoT) 구조를 채택했습니다.

Cosmos 3 베이스 체크포인트는 어떤 토큰을 노이즈로 설정하느냐에 따라 3가지 모드로 전환됩니다.

작동 모드입력 상태 (Clean)출력 대상 (Noisy 노이즈 제거)주요 용도
순역학 (Forward Dynamics)현재 프레임 + 행동미래 비디오롱테일 주행 및 조작 시나리오 합성 데이터 생성
역역학 (Inverse Dynamics)전후 2개 비디오 프레임행동원시 원격조작 영상 및 주행 영상의 행동 라벨링
정책 (Policy)3방향 뷰 이미지 + 고유수용감각32개 미래 관절 위치 + 비디오 잠재변수15Hz 제어 주기의 실기 로봇 배치 (예: DROID 데이터셋)

모델 제품군은 Cosmos3-Nano(16B 파라미터, 8B Qwen3-VL 백본 기반), Cosmos3-Super(64B 파라미터, 32B Qwen3-VL 백본 기반), 그리고 Jetson Thor/Orin 온디바이스 배치를 위해 2B 기반 백본에서 스크래치 학습된 Cosmos3-Edge(4B 파라미터)로 구성됩니다.

SageMaker HyperPod 기반 피지컬 AI 팩토리 구성

Cosmos 3의 아키텍처는 Amazon SageMaker HyperPod와 Amazon Elastic Kubernetes Service (Amazon EKS) 인프라로 연결됩니다. 생성, 사후 학습, 평가 작업이 단일 클러스터 제어 플레인 하의 단일 GPU 풀을 시분할 공유합니다.

"이 루프를 지속적으로 실행하는 데 드는 비용을 결정하는 지표는 단일 작업의 최고 처리량이 아닙니다. 전체 루프에 걸쳐 예약된 GPU 시간당 유용한 파이프라인 진행률을 나타내는 GPU 유효 처리량(goodput)입니다."

HyperPod InstantStart를 통한 에이전트 기반 인프라 운영

복잡한 파운데이션 모델 인프라 운영 부담을 줄이기 위해 오픈소스 제어 플레인인 HyperPod InstantStart가 도입되었습니다. InstantStart는 AWS 계정 내 단일 아웃오브밴드(out-of-band) 관리 컨테이너 형태로 구동되며, 포트 3099에서 웹 UI를 제공하는 동시에 Model Context Protocol (MCP) 서버를 통해 AI 에이전트 제어를 지원합니다.

  1. 사용자 입력 (웹 UI 또는 Kiro CLI)
  2. HyperPod InstantStart 제어 플레인
  3. 단일 백엔드 REST API 및 검증
  4. Amazon EKS 및 SageMaker HyperPod API 프로비저닝

InstantStart는 다음과 같은 원칙으로 인프라 배포를 단순화합니다.

확인된 수치

우리 관점

피지컬 AI 파이프라인의 성패는 모델 고도화뿐 아니라 지속적인 재학습 플라이휠을 지탱하는 인프라 효율성에 달려 있습니다. 엔비디아의 단일 모델 MoT 아키텍처와 AWS의 MCP 기반 에이전트 인프라 관리가 결합되면서, 물리 로봇 시스템의 상용화 진입 장벽이 대폭 낮아질 것으로 평가됩니다.

아직 확인되지 않은 것

출처

카탈로그로