Gemini 3.8 패밀리 총출동: 음성·시각·추론·보안의 전방위 진화

구글 딥마인드가 실시간 시각 대화 아바타와 확장 추론 음성 모델, 전문 보안 특화 모델, 고표현력 음성 합성 모델을 포함한 Gemini 3.8 라인업을 일제히 공개했습니다. 실시간 스트리밍 대화 중 백그라운드 도구 호출을 수행하는 Live 시리즈와 100개 이상의 언어를 지원하는 맞춤형 TTS 엔진이 도입되었습니다. 특히 소프트웨어 엔지니어링 및 사이버 보안 취약점 패칭에서 이전 세대 대비 현저한 벤치마크 상승을 기록하면서도 기존 플래시 모델 수준의 가격 정책을 유지했습니다.

Gemini 3.8 패밀리의 전방위 확장

구글 딥마인드가 실시간 대화, 심층 추론, 맞춤형 음성 합성, 사이버 보안 방어에 특화된 차세대 인공지능 모델 라인업인 Gemini 3.8 패밀리를 공식 발표했습니다. 이번 릴리즈는 단순한 텍스트 및 멀티모달 벤치마크 경쟁을 넘어, 실제 프로덕션 환경에서 구동 가능한 실시간 에이전트 인터페이스와 전문화된 방어 시스템 구축에 초점을 맞추고 있습니다.

발표된 주요 모델군은 다음과 같이 구성됩니다.

---

실시간 멀티모달과 동시 추론: Live 및 Live Avatar

`Gemini 3.8 Live`와 `Gemini 3.8 Live Extended Thinking`은 사용자의 음성과 시각 입력을 실시간으로 수용하면서 병렬 연산을 수행합니다. 핵심 기능은 비동기 도구 호출(Asynchronous Tool Calling)로, 대화 흐름을 중단하지 않고 백그라운드에서 API 호출이나 데이터 검색을 처리합니다.

  1. 실시간 음성/시각 입력
  2. 진행 상황 구두 안내
  3. 백그라운드 도구 실행
  4. 결과 반영 대화 지속

3.8 Live Extended Thinking 모델은 복잡한 다단계 작업을 수행할 때 "확인해 보겠습니다"와 같은 구두 신호와 실시간 진행 상황 내레이션을 제공합니다. 또한 `Gemini 3.8 Live with Live Avatar`는 저지연 스트리밍 비디오를 직접 결합하여 대화 상대의 시각적 페르소나를 렌더링합니다.

벤치마크 평가에서도 Live Extended Thinking은 음성 및 에이전트 성능 지표 전반에서 최상위권을 기록했습니다.

벤치마크 지표Gemini 3.8 Live Extended Thinking 점수
Speech to Speech Quality Index (Artificial Analysis)82.6 (#1)
Big Bench Audio97.7%
τ-Voice (에이전트 작업 완료도)68.6%
τ-Voice-banking (Sierra 금융 벤치마크)35.1%

---

지능과 비용 효율성의 조화: Flash 및 Flash Cyber

`Gemini 3.8 Flash`는 3.7 Flash 대비 소프트웨어 엔지니어링 및 도메인 특화 추론 성능이 대폭 강화되었습니다. 입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75라는 기존 3.7 Flash의 가격을 유지하면서 고비용 프론티어 모델에 근접하는 지표를 기록했습니다.

함께 공개된 `Gemini 3.8 Flash Cyber`는 보안 방어자를 위해 설계된 특화 모델로, Fairwind Program을 통해 공인된 보안 주체 및 인프라 운영자에게 우선 배포됩니다.

"Chrome 보안 팀의 검증 결과, 3.8 Flash Cyber는 훨씬 더 거대한 상용 프론티어 모델 대비 Chrome 취약점에 대해 2.6배 더 많은 정확한 패치를 생성했습니다."

20개 프로그래밍 언어에 걸친 내부 취약점 탐지 벤치마크에서 70% 이상의 성공률을 기록했으며, Collinear의 자동 패칭 벤치마크인 CWE-Bench에서 pass@1 47.2%를 기록하여 선두 프론티어 모델(47.8%) 수준에 도달했습니다. 또한 구글 클라우드 취약점 연구팀은 일반적으로 수개월이 소요되는 근본적 핵심 취약점을 2시간 이내에 식별하는 데 이 모델을 활용했습니다.

---

스튜디오급 음성 연출과 커스텀 보이스: Gemini 3.8 TTS

새롭게 추가된 `Gemini 3.8 Flash TTS`와 대량 처리에 최적화된 `Gemini 3.8 Flash-Lite TTS`는 정적 프리셋을 넘어 사용자가 직접 연출을 지시할 수 있는 오디오 생성 환경을 제공합니다.

독립 개발자 생태계에서도 실질적인 구현이 검증되었습니다. 개발자 사이먼 윌리슨(Simon Willison)의 테스트 결과, Gemini API의 CORS 정책을 활용한 웹 인터페이스에서 Gemini 3.8 Flash TTS를 통해 1분 18초 분량의 2인 대화 오디오를 생성하는 데 약 20초가 소요되었으며 비용은 2.74센트가 발생했습니다.

음성 품질 평가 벤치마크인 Hume AI Voice Design Benchmark에서 3.8 Flash TTS는 종합 71.4점으로 1위를 차지했으며, 악센트 모델링 부문에서도 60.8점으로 1위를 기록했습니다.

---

엔터프라이즈 및 개발자 생태계 배포 현황

구글은 이번 모델군을 Gemini API, Google AI Studio, Gemini Enterprise 및 구글 워크스페이스 전반에 순차적으로 통합하고 있습니다.

Verified figures

Our take

구글 딥마인드가 음성, 영상 생성, 심층 추론을 결합하여 실시간 에이전트의 완성도를 크게 끌어올렸습니다. 가격 인상 없이 도메인 특화 모델(Cyber)과 표현력 높은 오디오 모델을 동시에 확장함으로써 엔터프라이즈 도입 장벽을 낮추고 있습니다. 실시간 대화 중 비동기 도구 호출이 가능해짐에 따라 차세대 음성 에이전트 인터페이스 시장의 주도권 경쟁이 본격화될 것입니다.

Open questions

Models mentioned

ProviderInputOutputContext window
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

Source

Back to catalog