AWS 베드록, 그록 4.6 및 키미 K3 동시 탑재로 에이전트 인프라 혁신

AWS가 자사 AI 플랫폼 아마존 베드록(Amazon Bedrock)에 xAI의 최신 프론티어 모델 '그록 4.6(Grok 4.6)'과 문샷 AI(Moonshot AI)의 2.8조 파라미터 오픈 모델 '키미 K3(Kimi K3)'를 전격 출시했습니다. 그록 4.6은 50만 토큰 컨텍스트와 4단계 추론 강도 조절 기능을 갖추고 장기 실행 에이전트에 최적화되었으며, 키미 K3는 100만 토큰 컨텍스트와 오픈 모델 최초의 명시적 프롬프트 캐싱을 지원합니다. 두 모델 모두 글로벌 크로스 리전 추론과 유연한 비용 절감 옵션을 지원하여 대규모 기업용 에이전트 및 코딩 워크플로우 배포 환경을 크게 확장했습니다.

아마존 베드록, 프론티어와 대규모 오픈 모델 라인업 동시 확장

기업용 생성형 AI 인프라 시장에서 모델 선택권과 엔터프라이즈 기능의 결합이 가속화되고 있습니다. AWS는 2026년 8월, 자사의 완전관리형 AI 서비스인 아마존 베드록(Amazon Bedrock) 카탈로그에 xAI의 그록 4.6(Grok 4.6)과 문샷 AI의 키미 K3(Kimi K3)를 잇달아 추가했다고 발표했습니다.

이번 출시는 상용 프론티어 모델 진영의 대표주자인 xAI와 고성능 오픈 가중치(Open-weight) 모델을 선도하는 문샷 AI의 플래그십 모델이 AWS 엔터프라이즈 보안 경계 내로 통합되었음을 의미합니다. 두 모델 모두 대규모 컨텍스트 처리, 장기 실행(long-running) 에이전트, 복잡한 소프트웨어 엔지니어링 및 지식 업무에 초점을 맞추어 설계되었습니다.

모델명제공사파라미터 규모 / 특이사항컨텍스트 윈도우지원 엔드포인트
Grok 4.6xAI프론티어 추론 모델 (4단계 추론 조절)500K (50만 토큰)`bedrock-runtime`, `bedrock-mantle`
Kimi K3Moonshot AI2.8조 파라미터 오픈 가중치 모델1,000K (100만 토큰)`bedrock-runtime`

---

xAI 그록 4.6: 장기 실행 에이전트와 자가 검증 추론의 구현

2026년 8월 18일 아마존 베드록에 출시된 xAI의 그록 4.6은 앞서 출시되었던 그록 4.3에 이은 xAI의 두 번째 베드록 탑재 모델입니다. 그록 4.6은 500K(50만) 토큰 컨텍스트 윈도우를 제공하며, 작업의 난이도에 따라 `low`, `medium`, `high`, `xhigh`의 4단계 추론 강도(reasoning effort)를 설정할 수 있습니다.

학습 아키텍처와 에이전틱 강화학습

xAI의 발표에 따르면, 그록 4.6은 이전 세대인 그록 4.5보다 긴 보충 학습(supplemental training)을 거쳤습니다. 큐레이션된 모델 생성 데이터와 고품질 엔지니어링 데이터를 학습에 활용했으며, 최적화 기법 및 훈련 레시피를 전면 개선했습니다. 특히 그록 4.5를 활용하여 STEM, 소프트웨어 엔지니어링, 지식 업무 전반에 걸친 지도 미세조정(SFT) 궤적을 재생성하고, 모델 기반 검증을 통해 문제가 있는 트레이스를 걸러냈습니다.

이후 커널 최적화, 웹 개발, CAD(컴퓨터 지원 설계) 등 도메인 특화 환경과 일반 코딩 및 지식 작업을 아우르는 광범위한 에이전트 강화학습(Agentic Reinforcement Learning)을 수행했습니다. xAI는 에이전트 구축 시 주목해야 할 두 가지 주요 행동 패턴을 강조했습니다.

"장기적인 실행 궤적에서 모델은 다음 단계로 진행하기 전에 스스로의 작업을 확인하는 자가 테스트 및 검증(Self-testing and verification) 행동을 강화했습니다. 또한 시각 및 대화형 프로젝트에서 단 한 번의 패스로 애플리케이션의 구조와 시각적 언어를 탄탄하게 구축합니다."

베드록 런타임 통합 및 플랫폼 기능

기존 그록 4.3이 OpenAI 호환 추론 엔진인 `bedrock-mantle`을 통해서만 제공되었던 것과 달리, 그록 4.6은 표준 AWS SDK로 제어할 수 있는 `bedrock-runtime` 엔드포인트까지 지원 영역을 확장했습니다.

엔드포인트별 지원 기능에는 차이가 있습니다. JSON Schema 기반의 구조화된 출력(Structured Outputs)이 필요한 워크로드는 `bedrock-mantle`을 사용해야 하며, Converse API, 베드록 가드레일, CloudWatch 호출 로깅이 필요한 엔터프라이즈 아키텍처는 `bedrock-runtime` 엔드포인트를 선택해야 합니다.

---

문샷 AI 키미 K3: 2.8조 파라미터 오픈 가중치 모델과 명시적 캐싱

문샷 AI가 개발한 키미 K3(Kimi K3)는 아마존 베드록에 입점한 오픈 가중치 모델 중 단연 돋보이는 스펙을 자랑합니다. 문샷 AI에 따르면 키미 K3는 2.8조(2.8 Trillion) 파라미터에 도달한 최초의 오픈 모델로, 네이티브 비전 기능과 100만(1M) 토큰 컨텍스트 윈도우를 결합했습니다.

스케일링 효율과 오픈소스 에이전트 연동

키미 K3는 이전 세대인 Kimi K2 대비 스케일링 효율성을 약 2.5배(2.5x) 향상시켰습니다. 대규모 코드 베이스나 방대한 문서를 한 번에 로드하여 지속적인 컨텍스트 유지가 필요한 장기 실행 코딩 및 지식 워크플로우에 최적화되어 있습니다.

  1. AWS Bedrock 모델 선택
  2. OpenCode / Hermes 연동
  3. 명시적 프롬프트 캐싱 적용
  4. 장기 코딩 및 리서치 실행

키미 K3는 오픈소스 에이전트 프레임워크와의 결합성이 뛰어납니다. 베드록의 Converse API를 기본 지원하는 오픈소스 코딩 에이전트 OpenCode에서는 설정 파일(`opencode.json`)에 모델 프로필(`global.moonshotai.kimi-k3`)을 지정하여 단일 파일 브라우저 게임 제작과 같은 대규모 코딩을 수행할 수 있습니다. 또한 데스크톱 및 CLI 환경을 지원하는 범용 에이전트 Hermes Agent와 결합하여 심층 리서치 및 개인 맞춤형 학습 계획 생성 등의 자동화 작업을 수행할 수 있습니다.

업계 최초의 '명시적 프롬프트 캐싱' 도입

키미 K3는 아마존 베드록의 오픈 가중치 모델 중 최초로 명시적 프롬프트 캐싱(Explicit Prompt Caching)을 지원합니다.

엔터프라이즈 데이터 보안 및 무보존 원칙

베드록에 배포된 키미 K3는 모든 데이터가 AWS 보안 경계 내에서 처리됩니다. 고객 데이터는 문샷 AI를 포함한 외부 모델 제공업체로 전달되지 않으며 기저 모델 학습에도 활용되지 않습니다. 또한 기본 활성화된 데이터 무보존(Zero Data Retention) 정책과 AWS 운영자의 접근까지 차단하는 제로 오퍼레이터 액세스(Zero Operator Access)가 적용되어 금융 및 엔터프라이즈 환경에서도 안전하게 오픈 가중치 모델을 배포할 수 있습니다.

---

비용 최적화 인프라: 크로스 리전 라우팅 및 서비스 티어 비교

AWS는 그록 4.6과 키미 K3에 대해 지연 시간 완화와 가용성 확보, 비용 절감을 돕는 고급 라우팅 인프라를 제공합니다. 두 모델 모두 개별 리전에 직접 고정하는 방식 외에 크로스 리전 추론(Cross-Region Inference) 프로필을 통해 호출됩니다.

그록 4.6의 경우 Global 프로필 입력 가격은 100만 토큰당 $2.00로, US 프로필의 $2.20 대비 약 9% 저렴하며, 키미 K3 역시 Global 프로필이 Geo 프로필 대비 약 10% 저렴한 요금 구조를 가집니다.

그록 4.6 서비스 티어 승수 구조

그록 4.6은 워크로드의 실시간성 요구에 맞춰 3가지 서비스 티어를 지원합니다.

서비스 티어파라미터 값 (`service_tier`)기본 요율 대비 승수입력 토큰 예시 (In-Region Standard 기준)특징
Flex`flex`0.5x (50% 할인)$1.10 / 1M 토큰시간에 민감하지 않은 대규모 배치/비동기 에이전트 작업
Standard`default` (또는 생략)1.0x (기준 요율)$2.20 / 1M 토큰일반적인 온디맨드 호출
Priority`priority`1.75x (75% 할증)$3.85 / 1M 토큰지연 시간에 극도로 민감하고 빠른 응답이 필요한 워크로드

이러한 승수 구조는 단순한 리전 선택보다 서비스 티어 선택이 전체 TCO(총소유비용)를 결정하는 데 훨씬 더 직접적인 영향을 미친다는 점을 보여줍니다.

---

대규모 지능과 경제성의 균형: 에이전트 워크로드의 전환점

아마존 베드록의 이번 라인업 확장은 에이전트 아키텍처를 설계하는 엔지니어링 팀에게 중요한 전환점을 제시합니다. 50만 토큰의 컨텍스트와 심층 추론이 필요한 고난도 미션 크리티컬 작업에는 자가 검증이 강화된 그록 4.6을, 100만 토큰에 달하는 방대한 코드베이스 분석 및 비용 효율적인 대규모 장기 에이전트 작업에는 키미 K3와 명시적 프롬프트 캐싱을 결합하는 멀티 모델 분기 전략이 가능해졌습니다.

OpenAI 호환 API와 AWS Converse API가 공통으로 지원됨에 따라, 개발자는 클라이언트 인터페이스를 대대적으로 수정하지 않고도 작업의 성격과 예산에 맞추어 프론티어 상용 모델과 2.8조 파라미터 오픈 모델을 자유롭게 전환 및 조합할 수 있게 되었습니다.

確認された数値

編集部の見解

아마존 베드록의 이번 확장은 단일 모델 종속성을 탈피하고 프론티어 독점 모델(xAI)과 초대형 오픈 가중치 모델(Moonshot AI)을 단일 파이프라인에서 엮어 쓰려는 엔터프라이즈 수요를 정확히 겨냥했습니다. 특히 프롬프트 캐싱과 Flex 티어, 크로스 리전 라우팅의 결합은 고비용 구조에 갇혀 있던 장기 실행 에이전트의 상용화 단가를 현실화하는 기폭제가 될 것입니다.

未確認の点

記事で言及されたモデル

プロバイダー入力出力コンテキスト長
MoonshotAI: Kimi K3 · Moonshot AI$0.72$141,048,576
SpaceXAI: Grok 4.6 · xAI$2$6500,000

出典

カタログへ