AWS 세이지메이커 2026 추론 혁신과 지능형 게이트웨이

AWS가 생성형 AI 추론 효율성과 GPU 자원 최적화를 위해 세이지메이커(SageMaker) 관리형 엔드포인트와 하이퍼팟(HyperPod) 인프라 전반에 걸친 13개 신규 기능 및 지능형 라우팅 게이트웨이를 발표했습니다. 하이퍼팟 추론 게이트웨이는 GPU 내부의 KV 캐시와 LoRA 어댑터 상태를 실시간 감지해 첫 토큰 생성 지연 시간(TTFT)을 최대 82% 단축합니다. 관리형 엔드포인트 또한 자동 벤치마킹, 인스턴스 대체 풀, 컨테이너 캐싱을 통한 콜드 스타트 51% 단축 및 OpenAI 호환 API를 지원하여 엔터프라이즈의 인프라 운영 복잡도를 획기적으로 낮췄습니다.

생성형 AI 추론의 구조적 한계와 AWS의 2가지 접근 경로

생성형 AI 모델의 서빙 환경은 기존 전통적인 머신러닝 모델 배포와 근본적으로 다릅니다. 수십에서 수백 기가바이트(GB)에 달하는 방대한 파라미터 크기, 초당 토큰 수(tokens/sec) 단위로 측정되는 엄격한 레이턴시 요구치, 컨테이너 및 가중치 다운로드로 인해 수 분씩 소요되는 콜드 스타트(Cold Start), 극심한 GPU 공급 제약이 결합되어 있기 때문입니다. 더욱이 기존의 표준 모니터링 도구로는 실제 프로덕션 환경에서 필수적인 토큰 레벨의 내부 지표를 확인할 수 없다는 문제가 있었습니다.

AWS는 세이지메이커 AI(Amazon SageMaker AI)를 통해 토큰 단위 과금이 아닌 인스턴스 단위 소비 방식으로 모델을 배포할 수 있는 두 가지 경로를 제시하고 있습니다. 인프라 프로비저닝과 스케일링을 AWS에 완전히 위임하는 관리형 엔드포인트(Managed Endpoints) 경로와, 전용 GPU 클러스터에 대한 쿠버네티스 네이티브 제어권이 필요한 조직을 위한 세이지메이커 하이퍼팟 추론(HyperPod Inference) 경로입니다. 2026년 현재까지 AWS는 이 두 경로 전반에 걸쳐 총 13개의 신규 기능을 출시하며 대규모 추론 인프라의 효율화를 본격화했습니다.

  1. 사용자 요청 유입
  2. 워크로드 특성 분석
  3. AWS 완전 관리형 엔드포인트 선택 OR 쿠버네티스 네이티브 하이퍼팟 클러스터 선택
  4. 최적화 라우팅 및 서빙 실행

---

관리형 엔드포인트: 자동화 추천부터 컨테이너 캐싱까지 7대 기능 개선

인프라 운영 부담을 최소화하려는 조직을 위한 세이지메이커 관리형 엔드포인트에는 배포, 용량, 연동, 스케일링, 관측성을 포괄하는 7가지 기능이 추가되었습니다.

1. 추론 추천 및 자동 벤치마킹 (Inference Recommendations)

생성형 AI 모델에 최적화된 인스턴스 타입, 서빙 컨테이너, 튜닝 파라미터를 선정하는 작업은 통상 1,000개 이상의 조합을 대상으로 2~3주의 수동 벤치마킹이 필요했습니다. 세이지메이커 추론 추천 엔진은 모델 아키텍처를 분석해 인스턴스 공간을 축소(Narrow)하고, 처리량 최적화를 위한 EAGLE 3.0 추측 디코딩(Speculative Decoding) 및 텐서 병렬화 등을 적용(Optimize)한 뒤, NVIDIA AIPerf를 통해 실제 GPU 인프라에서 다중 실행 검증(Benchmark)을 거칩니다. 실제로 `GPT-OSS-20B` 모델 테스트에서 동일한 요청 지연 시간 내에 초당 토큰 처리량을 2배 향상시키는 최적 구성을 도출했습니다.

2. 용량 인식 인스턴스 풀 (Capacity-aware Instance Pools)

특정 단일 인스턴스 타입의 가용 용량이 부족할 경우 엔드포인트 생성 자체가 실패하던 문제를 방지하기 위해, 최대 5개의 인스턴스 타입을 우선순위 목록으로 지정할 수 있게 되었습니다. 생성 시 및 스케일아웃 시 1순위 인스턴스가 부족하면 즉시 대체 인스턴스로 폴백하며, 스케일인 시에는 대체 인스턴스부터 먼저 제거되어 선호 하드웨어로 자동 복귀합니다.

3. OpenAI 호환 API 지원

기존 OpenAI SDK, LangChain, Strands Agents 기반 애플리케이션을 세이지메이커 호환 환경으로 전환할 때 필요했던 커스텀 어댑터 작성이 제거되었습니다. `/openai/v1` 엔드포인트 경로를 통해 스트리밍을 포함한 Chat Completions를 그대로 호출할 수 있으며, 기존 AWS 자격 증명 기반으로 최대 12시간 유효한 베어러(Bearer) 토큰 인증을 지원하여 SigV4 서명 복잡성을 없앴습니다.

4. 컨테이너 캐싱 (Container Caching)

트래픽 급증 시 10GB 이상의 대형 서빙 컨테이너 이미지를 Amazon ECR로부터 새로 내려받는 데 걸리던 지연을 없애기 위해 로컬 사전 풀링(Pre-pull) 기술이 도입되었습니다. `Qwen3-8B` 모델을 `ml.g6.2xlarge` 인스턴스(LMI 컨테이너 17.7GB 압축본)에서 테스트한 결과, 엔드투엔드 시작 지연 시간이 525초에서 258초로 51% 감소하였으며, 네트워크 대역폭 경쟁이 해소되어 순수 모델 다운로드 시간도 168초에서 77초로 단축되었습니다.

개선 항목적용 전 (기본 ECR 풀)적용 후 (컨테이너 캐싱)개선율
엔드투엔드 시작 지연 시간525초258초51% 단축
모델 가중치 다운로드 시간168초77초54% 단축
초기 트래픽 대응 대기 시간수 분 소요인스턴스 즉시 기동38%~65% 범위 단축

5. 비동기 인라인 페이로드 및 상세 관측성 대시보드

비동기 추론(Async Inference) 호출 시 작은 용량의 입력값도 반드시 Amazon S3에 선행 업로드해야 했던 구조를 개선하여, `InvokeEndpointAsync` API를 통해 최대 128,000 바이트 크기의 페이로드를 인라인 Body로 직접 전송할 수 있게 되었습니다. 또한 기본 제공되는 OpenTelemetry 기반의 CloudWatch 대시보드를 통해 첫 토큰 도달 시간(TTFT), 토큰 간 지연 시간(ITL), KV 캐시 사용률 등 100개 이상의 추론 전용 지표가 기본 노출됩니다.

---

접두사 인식 라우팅(Prefix-Aware Routing)의 캐시 재사용성

RAG(검색 증강 생성)나 다자간 대화, 코드 완성형 워크로드는 프롬프트의 상당 부분(시스템 지시문, 검색된 문서, 이전 대화 이력)이 요청 간에 중복되는 특성을 갖습니다. 기본 라우팅 방식은 이러한 공통 토큰을 매 인스턴스마다 GPU에서 처음부터 다시 계산하는 비효율을 유발했습니다.

"접두사 인식 라우팅은 각 요청의 시작 부분을 지문(Fingerprint)으로 활용하여 동일하거나 유사한 프롬프트를 처리했던 인스턴스로 요청을 일관되게 전달함으로써 KV 캐시 재사용을 극대화합니다."

`Llama 3.1 70B` 모델을 7대 인스턴스에 배포해 진행한 실증 벤치마크 결과는 다음과 같습니다.

세이지메이커는 이제 기존 `RANDOM`, `LEAST_OUTSTANDING_REQUESTS`에 더해 `PREFIX_AWARE` 라우팅 전략을 공식 지원합니다.

---

하이퍼팟 추론 게이트웨이: 쿠버네티스 네이티브 L7 지능형 라우팅

자체 GPU 클러스터를 운영하는 환경에서는 쿠버네티스의 기본 라운드로빈(Round-Robin) 및 최소 연결 방식이 GPU 내부 상태(KV 캐시 포화 여부, 긴 문맥 연산 진행 여부, LoRA 어댑터 상주 여부)를 전혀 알지 못해 심각한 병목을 유발해 왔습니다. 이로 인해 바쁜 파드 뒤로 요청이 쌓이며 첫 토큰 지연이 4초 이상으로 치솟는 현상이 발생했습니다.

새롭게 발표된 세이지메이커 하이퍼팟 추론 게이트웨이(SageMaker HyperPod Inference Gateway)는 쿠버네티스 게이트웨이 API 추론 확장(Gateway API Inference Extension) 표준을 기반으로 구축된 2계층 아키텍처 시스템입니다.

1계층: 클러스터별 게이트웨이 (EKS 관리형 애드온)

클러스터에 `amazon-sagemaker-hyperpod-inference` 애드온 형태로 설치되며 다음 컴포넌트로 동작합니다.

2계층: 글로벌 추론 라우터 (Global Inference Router, 출시 예정)

향후 추가될 2계층은 여러 클러스터 및 리전에 걸친 교차 장애 조치(Cross-cluster failover), 전역 속도 제한, 비용 기반 트래픽 셰이핑을 중앙에서 제어하게 됩니다.

---

이종 하드웨어 및 버스트 환경 실증 성능

하이퍼팟 추론 게이트웨이는 H100(`p5.48xlarge`)과 A10G(`g5`) 등 8B부터 235B 파라미터 규모의 4개 모델 환경에서 기본 라운드로빈 대비 탁월한 성능 개선을 입증했습니다.

"기존 라운드로빈 하에서 4.4초 동안 첫 번째 토큰을 기다려야 했던 챗봇 사용자는 이제 800밀리초(ms) 미만으로 첫 응답을 확인할 수 있습니다."

기존 라운드로빈 방식4400
지능형 추론 게이트웨이800

실증 테스트 결과, 추론 게이트웨이의 효과는 다음 3가지 조건에서 극대화됩니다.

모든 설정은 `InferenceGatewayConfig` 커스텀 리소스 정의(CRD) 단 하나로 선언되며, 사이드카나 서비스 메시 추가 없이 기존 vLLM, SGLang, TGI 등의 오픈소스 서빙 엔진과 OpenAI 규격으로 완벽히 호환됩니다.

확인된 수치

우리 관점

생성형 AI의 병목이 모델 학습에서 운영 서빙과 추론 비용으로 완전히 이동한 상황에서, AWS는 단순한 인프라 증설 대신 GPU 내부 상태(KV 캐시, LoRA 상주)를 인지하는 지능형 L7 라우팅을 핵심 해법으로 제시했습니다. 특히 쿠버네티스 게이트웨이 API 표준과 OpenAI 규격을 적극 수용한 점은 고객의 벤더 종속 우려를 덜어주면서 엔터프라이즈 멀티 모델 에이전트 인프라를 흡수하려는 전략적 진화로 평가됩니다.

아직 확인되지 않은 것

기사에 언급된 모델

프로바이더입력출력컨텍스트 윈도우
Llama 3.1 70B (Groq LPU) · Groq$0.59$0.79131,072
OpenAI: gpt-oss-20b · OpenAI$0.018$0.09131,072

출처

카탈로그로