Gemini 3.8 패밀리의 전방위 확장
구글 딥마인드가 실시간 대화, 심층 추론, 맞춤형 음성 합성, 사이버 보안 방어에 특화된 차세대 인공지능 모델 라인업인 Gemini 3.8 패밀리를 공식 발표했습니다. 이번 릴리즈는 단순한 텍스트 및 멀티모달 벤치마크 경쟁을 넘어, 실제 프로덕션 환경에서 구동 가능한 실시간 에이전트 인터페이스와 전문화된 방어 시스템 구축에 초점을 맞추고 있습니다.
발표된 주요 모델군은 다음과 같이 구성됩니다.
- Gemini 3.8 Live 및 Live Extended Thinking: 실시간 비디오 및 오디오 입력 처리와 다단계 추론을 결합한 대화형 에이전트 모델
- Gemini 3.8 Live with Live Avatar: 실시간 스트리밍 비디오 생성과 정밀한 립싱크를 결합한 시각적 아바타 대화 인터페이스
- Gemini 3.8 Flash 및 3.8 Flash Cyber: 소프트웨어 엔지니어링 및 취약점 탐지·패치 자동화에 특화된 추론 모델
- Gemini 3.8 Flash TTS 및 Flash-Lite TTS: 대본 단위의 세부 연기 지시와 맞춤형 음성 복제가 가능한 차세대 음성 합성 엔진
---
실시간 멀티모달과 동시 추론: Live 및 Live Avatar
`Gemini 3.8 Live`와 `Gemini 3.8 Live Extended Thinking`은 사용자의 음성과 시각 입력을 실시간으로 수용하면서 병렬 연산을 수행합니다. 핵심 기능은 비동기 도구 호출(Asynchronous Tool Calling)로, 대화 흐름을 중단하지 않고 백그라운드에서 API 호출이나 데이터 검색을 처리합니다.
- 실시간 음성/시각 입력
- 진행 상황 구두 안내
- 백그라운드 도구 실행
- 결과 반영 대화 지속
3.8 Live Extended Thinking 모델은 복잡한 다단계 작업을 수행할 때 "확인해 보겠습니다"와 같은 구두 신호와 실시간 진행 상황 내레이션을 제공합니다. 또한 `Gemini 3.8 Live with Live Avatar`는 저지연 스트리밍 비디오를 직접 결합하여 대화 상대의 시각적 페르소나를 렌더링합니다.
- 97개 언어 실시간 전환: 대화 도중 언어가 변경되어도 비디오 품질 저하나 시각적 드리프트 없이 립싱크와 표정을 실시간으로 조정합니다.
- 브랜드 맞춤형 아바타 생성: 고품질 참조 이미지 1장을 기반으로 브랜드 스타일과 일치하는 맞춤형 아바타를 생성할 수 있으며, 기업 허용 목록(Allowlist) 등록을 통해 제공됩니다.
- SynthID 워터마킹 내장: 생성된 모든 오디오 및 비디오 출력물에는 육안으로 식별 불가능한 워터마크가 적용되어 AI 생성 여부를 추적할 수 있습니다.
벤치마크 평가에서도 Live Extended Thinking은 음성 및 에이전트 성능 지표 전반에서 최상위권을 기록했습니다.
| 벤치마크 지표 | Gemini 3.8 Live Extended Thinking 점수 |
|---|---|
| Speech to Speech Quality Index (Artificial Analysis) | 82.6 (#1) |
| Big Bench Audio | 97.7% |
| τ-Voice (에이전트 작업 완료도) | 68.6% |
| τ-Voice-banking (Sierra 금융 벤치마크) | 35.1% |
---
지능과 비용 효율성의 조화: Flash 및 Flash Cyber
`Gemini 3.8 Flash`는 3.7 Flash 대비 소프트웨어 엔지니어링 및 도메인 특화 추론 성능이 대폭 강화되었습니다. 입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75라는 기존 3.7 Flash의 가격을 유지하면서 고비용 프론티어 모델에 근접하는 지표를 기록했습니다.
- HLE-Verified: STEM, 인문학, 전문 분야 전반의 다단계 추론 벤치마크에서 54.9%를 기록했습니다.
- 자율 엔지니어링: DeepSWE v1.1 장기 소프트웨어 엔지니어링 벤치마크에서 복잡한 과제를 자율적으로 완수했습니다.
- 도메인 특화 에이전트: Vals Finance Agent V2(금융) 및 Harvey Legal Agent Benchmark(법률)에서 전작을 상회하는 신뢰도를 입증했습니다.
함께 공개된 `Gemini 3.8 Flash Cyber`는 보안 방어자를 위해 설계된 특화 모델로, Fairwind Program을 통해 공인된 보안 주체 및 인프라 운영자에게 우선 배포됩니다.
"Chrome 보안 팀의 검증 결과, 3.8 Flash Cyber는 훨씬 더 거대한 상용 프론티어 모델 대비 Chrome 취약점에 대해 2.6배 더 많은 정확한 패치를 생성했습니다."
20개 프로그래밍 언어에 걸친 내부 취약점 탐지 벤치마크에서 70% 이상의 성공률을 기록했으며, Collinear의 자동 패칭 벤치마크인 CWE-Bench에서 pass@1 47.2%를 기록하여 선두 프론티어 모델(47.8%) 수준에 도달했습니다. 또한 구글 클라우드 취약점 연구팀은 일반적으로 수개월이 소요되는 근본적 핵심 취약점을 2시간 이내에 식별하는 데 이 모델을 활용했습니다.
---
스튜디오급 음성 연출과 커스텀 보이스: Gemini 3.8 TTS
새롭게 추가된 `Gemini 3.8 Flash TTS`와 대량 처리에 최적화된 `Gemini 3.8 Flash-Lite TTS`는 정적 프리셋을 넘어 사용자가 직접 연출을 지시할 수 있는 오디오 생성 환경을 제공합니다.
- 프롬프트 기반 음성 생성: 자연어 프롬프트 입력을 통해 100개 이상의 언어 및 방언 환경에서 완전히 새로운 보컬 캐릭터를 생성할 수 있습니다.
- 30초 샘플 기반 음성 복제: 30초 분량의 음성 샘플을 업로드하여 일관된 보컬 프로필을 재현할 수 있으며, 음성 소유자의 음성 동의 녹음 검증과 C2PA 인증 정보가 적용됩니다.
- 대본 단위 세부 연출: 감정 톤 지시문뿐만 아니라 `<laughs>`, `<sigh>`, `<gasp>`와 같은 비언어적 표현 및 `|mhm|`, `|yeah|`와 같은 맞춤형 추임새(Backchanneling)를 대본에 직접 표기하여 다자간 대화를 생성할 수 있습니다.
독립 개발자 생태계에서도 실질적인 구현이 검증되었습니다. 개발자 사이먼 윌리슨(Simon Willison)의 테스트 결과, Gemini API의 CORS 정책을 활용한 웹 인터페이스에서 Gemini 3.8 Flash TTS를 통해 1분 18초 분량의 2인 대화 오디오를 생성하는 데 약 20초가 소요되었으며 비용은 2.74센트가 발생했습니다.
음성 품질 평가 벤치마크인 Hume AI Voice Design Benchmark에서 3.8 Flash TTS는 종합 71.4점으로 1위를 차지했으며, 악센트 모델링 부문에서도 60.8점으로 1위를 기록했습니다.
---
엔터프라이즈 및 개발자 생태계 배포 현황
구글은 이번 모델군을 Gemini API, Google AI Studio, Gemini Enterprise 및 구글 워크스페이스 전반에 순차적으로 통합하고 있습니다.
- 개발자 도구: Gemini API를 통해 Agora, LiveKit, Pipecat, Vercel, LangChain, Fishjam 등의 미디어 스트리밍 플랫폼과 연동되어 실시간 음성 에이전트 인프라 구축을 지원합니다.
- 엔터프라이즈 환경: Gemini Enterprise에 3.8 Live with Live Avatar가 탑재되었으며, 3.8 Live 및 Extended Thinking은 비공개 프리뷰(Private Preview) 형태로 제공됩니다.
- 보안 프로그램: 3.8 Flash Cyber는 Fairwind Program을 통해 정부 기관 및 핵심 인프라 관리자에게 선별 제공되며 화학·생물·방사능·핵(CBRN) 및 사이버 공격 악용 방지 안전장치가 적용됩니다.