AWS 베드록, GPT-6.1 Sol 및 Grok 4.7 출시

아마존 베드록(Amazon Bedrock)에 OpenAI의 최신 모델 GPT-6.1 Sol과 xAI의 Grok 4.7이 공식 출시되었습니다. GPT-6.1 Sol은 GPT-6 Astra 수준의 추론 성능을 약 5분의 1 수준의 태스크당 비용으로 제공하여 소프트웨어 엔지니어링 및 복합 업무 워크플로를 최적화합니다. Grok 4.7은 500K 토큰의 확장된 컨텍스트와 4단계 추론 강도 조절, 자가 검증 메커니즘을 지원하여 장기 실행 에이전트 환경에서 오류 누적을 최소화합니다. 두 모델 모두 AWS의 하드웨어 격리 인프라, 교차 리전 프로파일, 세분화된 보안 제어 기능을 통해 엔터프라이즈 프로덕션 환경에 바로 배포할 수 있습니다.

프론티어 추론 모델의 확장과 에이전트 경제학의 전환

최근 생성형 AI 에이전트 아키텍처는 단순 질의응답을 넘어 정보 수집, 도구 호출, 오류 복구, 결과 검증으로 이어지는 다단계 작업을 자율적으로 수행하는 방향으로 진화하고 있습니다. 이러한 워크플로에서는 모델이 단 한 번의 잘못된 결정을 내릴 경우 불필요한 추가 호출과 지연 시간, 작업 실패에 따른 인간의 개입이 누적되어 전체 태스크 비용이 급증하게 됩니다. 따라서 에이전트 도입의 경제성은 단순 토큰 단가뿐만 아니라, 추론 품질(Reasoning Quality)을 통해 작업 완결까지 필요한 상호작용 횟수를 얼마나 단축하느냐에 따라 결정됩니다.

아마존웹서비스(AWS)는 이러한 에이전트 워크플로의 요구사항에 대응하여 GPT-6.1 Sol과 Grok 4.7을 아마존 베드록(Amazon Bedrock) 모델 카탈로그에 공식 추가했습니다. 두 모델은 코딩, 장기 실행(Long-running) 에이전트, 전문 지식 업무에 특화된 고급 추론 능력을 제공하며 엔터프라이즈 수준의 거버넌스 및 인프라 제어 기능과 결합되었습니다.

모델명주요 특징컨텍스트 윈도우핵심 벤치마크 및 성과 지표
GPT-6.1 Sol코딩, 컴퓨터 사용(Computer Use), 다단계 문서 분석표준 지원DeepSWE v1.1에서 GPT-6 Astra 성능을 1/5 비용으로 달성, GPT-6 Sol 대비 6.4%p 상승
Grok 4.7자가 검증(Self-verification), 장기 지식 작업, 강화학습 기반 추론500K 토큰다중 시간 소요 태스크(CursorBench, DeepSWE 등) 강화, 4단계 추론 강도 제어

---

GPT-6.1 Sol: 고난도 코딩 및 업무 자동화의 비용 효율화

OpenAI의 GPT-6.1 Sol은 소프트웨어 엔지니어링 및 비즈니스 도구 연동 작업에서 이전 세대인 GPT-6 Sol 대비 괄목할 만한 성능 향상을 입증했습니다. 소프트웨어 엔지니어링 평가 지표인 DeepSWE v1.1에서 최상위 모델인 GPT-6 Astra와 동등한 수준의 성능을 보이면서도, 태스크당 비용은 약 5분의 1 수준으로 낮췄습니다. 또한 이전 GPT-6 Sol의 최고 점수를 6.4%p 상회하며, 이때 소모된 추론 노력(Reasoning effort)은 오히려 더 낮았습니다.

```

  1. 코드베이스 탐색 및 의존성 추적
  2. 변경 지점 식별 및 구현
  3. 터미널·도구 기반 테스트
  4. 결과 검증 및 자동 수정

```

엔지니어링 툴체인 및 데스크톱 워크플로 통합

"소프트웨어 엔지니어링은 추론 품질이 전체 워크플로에 미치는 영향을 명확히 보여줍니다. GPT-6.1 Sol은 DeepSWE v1.1에서 GPT-6 Astra와 동등한 성능을 태스크당 약 5분의 1 비용으로 달성했습니다."

---

Grok 4.7: 500K 컨텍스트와 자기 검증 메커니즘

xAI가 개발한 Grok 4.7은 단순한 속도보다는 여러 시간에 걸쳐 수행되는 복잡한 작업의 완주력에 초점을 맞춘 프론티어 모델입니다. 새롭고 더 거대한 베이스 모델을 바탕으로 고난도 작업 비중을 높인 장기 강화학습(RL)을 거쳤습니다. 이를 통해 자가 검증(Self-verification) 능력을 내재화하여, 다음 단계로 넘어가기 전 자체 산출물을 점검함으로써 초기 실수가 후속 단계로 전파되어 전체 워크플로가 붕괴하는 현상을 줄였습니다.

4단계 추론 강도(Reasoning Effort) 제어

Grok 4.7은 추론 엔진의 동작 깊이를 4단계(`low`, `medium`, `high`, `xhigh`)로 나누어 설정할 수 있습니다. 기본 설정값은 `high`이며, 작업 복잡도에 따라 유연하게 제어할 수 있습니다.

독립 평가 기관인 Artificial Analysis의 지능 지수(Intelligence Index) 측정 결과에 따르면, Grok 4.7은 장기 에이전트 지식 작업과 코딩 영역에서 뚜렷한 성능 향상을 기록했으나, 최고 성능 모드에서는 태스크당 출력 토큰 수가 대략 2배가량 증가하는 트레이드오프가 확인되었습니다. 따라서 무조건적인 기본값 사용 대신 호출 성격에 맞는 강도 지정이 요구됩니다.

---

엔터프라이즈 아키텍처 및 보안·거버넌스 체계

두 모델 모두 Amazon Bedrock의 엔터프라이즈급 인프라 환경에서 운영됩니다. 특히 기업 보안과 규제 준수를 위한 강력한 제어 장치가 함께 제공됩니다.

인프라 보안 및 데이터 보호 정책

유연한 배포 옵션과 API 인터페이스

Grok 4.7의 경우 글로벌 트래픽 분산을 위한 Global 프로파일(`global.xai.grok-4.7`)과 데이터 레지던시를 보장하는 US 지리적 프로파일(`us.xai.grok-4.7`)을 제공합니다. 또한 처리 우선순위에 따라 Standard, Priority, Flex의 3가지 서비스 티어를 선택할 수 있습니다. API 레벨에서는 AWS 네이티브 SDK인 Converse API뿐만 아니라 OpenAI SDK 호환 엔드포인트(`/openai/v1`)를 지원하여 기존 통합 코드를 최소한의 수정으로 이전할 수 있습니다.

아울러 암호화된 추론 내용(`reasoning.encrypted_content`)을 후속 턴에 다시 전달함으로써 멀티턴 대화에서도 이전 추론 맥락을 유지할 수 있으며, Bedrock Guardrails를 연동하여 민감 정보(PII) 마스킹 및 유해 콘텐츠 필터링을 자동 적용할 수 있습니다.

Belegte Zahlen

Unsere Einschätzung

이번 AWS 베드록의 신규 모델 도입은 파운데이션 모델 경쟁이 단순 파라미터 크기나 벤치마크 점수 경쟁에서 벗어나 에이전트의 실제 태스크 완결률과 비용 효율성을 다투는 '에이전트 경제학' 단계로 본격 진입했음을 보여줍니다. 특히 엔터프라이즈 환경에서는 개별 토큰 가격보다 에이전트의 자기 검증 능력과 오류 없는 장기 실행 능력이 전체 TCO를 좌우하는 결정적 요인이 될 것입니다.

Offene Fragen

Erwähnte Modelle

AnbieterEingabeAusgabeKontextfenster
OpenAI: GPT-6 Astra · OpenAI$10$501,050,000
OpenAI: GPT-6 Sol · OpenAI$2$101,050,000
SpaceXAI: Grok 4.7 · xAI$2$6500,000

Quelle

Zurück zum Katalog