AWS vLLM-Omni 기반 멀티모달 실시간·비동기 서빙 아키텍처

AWS가 단일 딥러닝 컨테이너(DLC) 환경에서 음성, 이미지, 비디오 생성을 처리하는 vLLM-Omni 배포 아키텍처를 공개했습니다. 실시간 음성 상호작용을 위해 HTTP/2 양방향 스트리밍 기반 Qwen3-TTS 파이프라인을 구축하고, 이미지·비디오 생성에는 실시간과 비동기 방식을 결합한 하이브리드 방식을 적용했습니다. 동일한 컨테이너 이미지를 유지하면서 워크로드 특성에 맞춰 인스턴스와 엔드포인트를 분리해 서빙 인프라 운영 복잡도를 크게 낮췄습니다.

텍스트를 넘어선 전방위 미디어 서빙: vLLM-Omni DLC의 등장

대규모 언어 모델(LLM)의 발전이 텍스트 생성을 넘어 음성, 이미지, 비디오를 아우르는 멀티모달 영역으로 빠르게 확장되면서 인프라 서빙 스택의 복잡성도 급격히 증가하고 있습니다. 기존의 텍스트 전용 추론 런타임은 자귀회귀(Autoregressive) 생성 방식에 최적화되어 있어, 다단계 파이프라인이나 확산(Diffusion) 모델, 대용량 미디어 청크 스트리밍을 단일 구조 내에서 처리하기 어려웠습니다.

AWS는 이러한 서빙 파편화 문제를 해결하기 위해 vLLM-Omni Deep Learning Container(DLC) 기반의 다중 모달리티 호스팅 방식을 제시했습니다. vLLM-Omni는 기존 vLLM의 고성능 서빙 구조를 계승하면서도 오디오, 이미지, 비디오 모델을 OpenAI 호환 API 규격과 이기종 파이프라인 추상화(Heterogeneous Pipeline Abstraction)로 통합 지원합니다.

  1. 텍스트 프롬프트
  2. FLUX.2-klein 실시간 이미지 생성
  3. Wan2.1-VACE 비동기 비디오 렌더링
  4. S3 비디오 저장 및 스트리밍

초저지연 음성 대화를 위한 HTTP/2 양방향 스트리밍

대화형 음성 에이전트, 고객 지원 봇, 접근성 도구 등 실시간성이 필수적인 음성 애플리케이션에서는 긴 침묵 구간(Silent Pause)을 제거하는 것이 핵심 과제입니다. 모델이 전체 음성 생성을 완료할 때까지 대기하지 않고, 첫 번째 오디오 청크가 생성되는 즉시 클라이언트로 전달하는 스트리밍 아키텍처가 요구됩니다.

AWS는 Amazon SageMaker AI의 HTTP/2 기반 WebSocket 양방향 스트리밍 기능과 vLLM-Omni 컨테이너의 내부 라우팅을 결합했습니다.

"음성 에이전트와 고객 서비스 어시스턴트는 긴 침묵 구간 없이 응답해야 합니다. 이 튜토리얼에서는 전체 응답 생성이 끝나기 전에 음성 재생을 시작할 수 있는 TTS 모델을 Amazon SageMaker AI에 배포합니다."

이 구조는 앞서 공개된 Voxtral-Mini-4B 기반 실시간 음성-텍스트(STT) 파이프라인과 완벽히 대칭을 이루어, 입력 스트림(STT)과 출력 스트림(TTS)을 결합한 완전한 실시간 음성 에이전트 구성을 가능하게 합니다.

이미지·비디오 생성: 실시간과 비동기 추론의 하이브리드 결합

이미지와 비디오 생성은 워크로드의 연산량과 소요 시간, 페이로드 크기가 서로 크게 다릅니다. 사용자의 즉각적인 피드백이 필요한 이미지 생성은 실시간 엔드포인트로 처리하고, 긴 연산 시간이 소요되는 비디오 변환은 비동기 엔드포인트로 격리하는 설계가 필수적입니다.

AWS는 단일 컨테이너 이미지(`omni-sagemaker-cuda-v1.6`)를 공유하면서 엔드포인트 성격을 이원화하는 방식을 채택했습니다.

파이프라인 단계적용 모델서빙 방식라우트 경로기본 인스턴스
1단계 (이미지 생성)FLUX.2-klein-4B실시간 엔드포인트`/v1/images/generations`ml.g6.xlarge
2단계 (비디오 생성)Wan2.1-VACE-1.3B비동기 엔드포인트`/v1/videos/sync`ml.g6e.xlarge

다단계 페이로드 최적화

1. 이미지 생성: 클라이언트가 텍스트 프롬프트를 전송하면 FLUX.2-klein 모델이 base64 인코딩된 PNG 이미지를 즉시 반환합니다. 2. 페이로드 전처리: 비디오 모델의 입력 규격에 맞추어 이미지를 480x320 크기로 리사이징하고 압축된 JPEG Data URL로 변환합니다. 이는 멀티파트 파서의 파트별 크기 제한을 초과하지 않도록 설계된 조치입니다. 3. 비동기 큐잉 및 S3 연계: SageMaker Asynchronous Inference의 인라인 본문 크기 제한(Body 128,000바이트)을 고려하여, 멀티파트 요청을 Amazon S3에 업로드하고 `InputLocation`을 통해 엔드포인트를 호출합니다. 모델은 디코딩 시 메모리 피크를 줄이기 위해 VAE 타일링 기법을 적용합니다.

인프라 효율화 및 실측 성능 분석

단일 DLC 이미지를 사용하면서 환경 변수 `SM_VLLM_MODEL`만 변경해 서로 다른 모달리티 모델을 구동하는 구조는 컨테이너 레지스트리 관리 및 보안 패치 적용 등의 MLOps 운영 비용을 크게 낮춥니다.

또한 SageMaker의 인스턴스 풀(Instance Pools) 기능을 활용해 `ml.g6.xlarge`를 우선 프로비저닝하고, 가용 용량 부족 시 `ml.g6e.xlarge`, `ml.g5.xlarge`, `ml.g4dn.xlarge` 순으로 자동 대체하도록 구성할 수 있습니다.

실제 미국 동부(버지니아 북부) 리전에서 측정된 단일 검증 실행 지표는 다음과 같습니다.

확인된 수치

우리 관점

멀티모달 모델 확산에 따른 엔터프라이즈의 가장 큰 고민은 파편화된 서빙 프레임워크 유지보수였습니다. vLLM-Omni 기반의 단일 DLC 환경과 SageMaker의 실시간·비동기·양방향 스트리밍 결합은 프로덕션 멀티모달 서비스 구축의 표준 패턴으로 자리 잡을 가능성이 높습니다.

아직 확인되지 않은 것

출처

카탈로그로