6주간 3회 연속 릴리스: 제미나이 3.8 패밀리의 전면적 확장
구글 딥마인드가 Gemini 3.8 라인업을 대거 공개하며 멀티모달 실시간 에이전트 생태계의 판도를 재편하고 있습니다. 이번 발표는 3.7 Flash 공개 이후 3주 만에 단행되었으며, 불과 6주 만에 세 번째 플래시 모델을 선보이는 가파른 개발 속도를 증명했습니다. 제미나이 3.8 패밀리는 경량화 추론 엔진인 Gemini 3.8 Flash, 사이버 보안 전용 방어 모델인 Gemini 3.8 Flash Cyber, 실시간 음성 상호작용을 담당하는 Gemini 3.8 Live 및 Gemini 3.8 Live Extended Thinking, 시각적 페르소나를 결합한 Gemini 3.8 Live with Live Avatar, 그리고 정교한 음성 연출이 가능한 Gemini 3.8 Flash TTS 및 Flash-Lite TTS로 구성됩니다.
- 실시간 시청각 입력
- 백그라운드 비동기 도구 연산
- 실시간 다국어 음성 생성
- 시각적 아바타 립싱크 출력
플래시 모델의 진화: 장기 코딩과 사이버 보안 특화
Gemini 3.8 Flash는 이전 세대인 3.7 Flash와 동일한 가격인 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75의 시작 가격을 유지하면서 소프트웨어 엔지니어링 및 자율 에이전트 추론 역량을 대폭 끌어올렸습니다. 장기 지속 소프트웨어 엔지니어링 벤치마크인 DeepSWE v1.1에서 대형 프론티어 모델들을 능가하는 성과를 거두었으며, 다학제 추론 벤치마크인 HLE-Verified에서 54.9%를 기록했습니다. 이와 함께 정량 분석 및 법률 분야를 측정하는 Vals Finance Agent V2와 Harvey's Legal Agent Benchmark에서도 기존 3.7 Flash 대비 우수한 성적을 냈습니다.
엔터프라이즈 방어를 위한 Gemini 3.8 Flash Cyber
공동 출시된 Gemini 3.8 Flash Cyber는 신뢰받는 보안 방어자들을 위한 전용 프로그램인 Fairwind Program을 통해 제공됩니다. 공격(Exploitation)보다는 방어 및 패치 생성에 초점을 맞추어 훈련되었습니다.
| 평가 지표 및 벤치마크 | Gemini 3.8 Flash Cyber 성과 | 비교 대상 및 기준 |
|---|---|---|
| 20개 언어 내부 취약점 벤치마크 | 70% 초과 | 내부 이전 세대 모델 대비 대폭 향상 |
| CWE-Bench (패치 능력) | 47.2% (pass@1) | 선도 프론티어 모델 (47.8%) 대등 수준 |
| Chrome 취약점 수정 | 2.6배 더 많은 정확한 패치 생성 | 상용 대형 모델 대비 우위 |
| Wiz 모의침투 벤치마크 | +7.5~9.7% 재현율 향상 | 2.3~5.2배 낮은 비용으로 달성 |
실제로 구글 클라우드 취약점 연구팀은 연구에 수개월이 소요되던 중대한 기반 취약점을 Gemini 3.8 Flash Cyber를 활용해 2시간 미만 만에 찾아냈습니다.
실시간 음성 에이전트와 비동기 병렬 연산
Gemini 3.8 Live 제품군은 대화 중단을 없앤 실시간 상호작용에 집중합니다. Gemini 3.8 Live Extended Thinking 모델은 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 전체 1위를 차지했으며, 에이전트 작업 완료도 벤치마크인 $\tau$-Voice에서 68.6%, $\tau$-Voice-banking에서 35.1%로 선두를 기록했습니다. Big Bench Audio 추론 지표에서도 97.7%를 달성했습니다.
"Gemini 3.8 Live Extended Thinking은 대화 흐름을 방해하지 않으면서 심층 추론과 음성 발화를 동시에 수행합니다. '확인해 보겠습니다'와 같은 초기 언어 단서를 활용해 요청을 인지하고, 백그라운드 작업 진행 상황을 실시간으로 중계합니다."
이들 모델은 대화 도중 97개 언어를 자동으로 감지하여 전환하며, 대화를 멈추지 않고 백그라운드에서 API 및 도구를 비동기 호출합니다. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 등의 개발자 플랫폼과 연동되어 실시간 미디어 스트리밍 인프라를 지원합니다.
Live Avatar: 97개 언어 실시간 립싱크와 시각적 페르소나
Gemini 3.8 Live with Live Avatar는 라이브 대화 모델에 저지연 스트리밍 비디오 생성을 결합하여 Gemini Enterprise 고객에게 제공됩니다. 사용자의 시각 및 오디오 입력을 실시간으로 처리하며, 동적 비주얼 페르소나를 통해 미세한 표정과 립싱크를 구현합니다.
- 무중단 비동기 도구 실행: 호텔 체크인 등 복잡한 태스크를 수행할 때 대화를 멈추지 않고 백그라운드 데이터 조회를 병렬 처리합니다.
- 97개 언어 실시간 동기화: 대화 중 언어가 바뀌어도 비디오 화질 저하나 시각적 왜곡(Visual drift) 없이 입모양과 표정을 적응시킵니다.
- 브랜드 맞춤형 아바타: 고화질 참조 이미지 한 장으로부터 브랜드 정체성을 유지하는 반응형 아바타 생성이 가능합니다(현재 엔터프라이즈 화이트리스트 기반 제공).
텍스트-투-스피치(TTS) 스튜디오와 창작 제어권
음성 생성 제품군으로는 Gemini 3.8 Flash TTS와 대량 처리에 최적화된 Gemini 3.8 Flash-Lite TTS가 출시되었습니다. 이 모델들은 Hume AI의 Voice Design Benchmark에서 71.4점, 액센트 모델링에서 60.8점을 기록하며 전체 1위에 올랐습니다.
| Voice Design (Flash TTS) | 71.4 |
| Accent Modeling (Flash TTS) | 60.8 |
| S2S Quality (Live ET) | 82.6 |
| Big Bench Audio (Live ET) | 97.7 |
- 자연어 기반 보컬 디자인: 100개 이상의 언어와 방언에 걸쳐 역할, 억양, 발성 특성을 프롬프트로 지정하여 새로운 목소리를 즉석 생성합니다.
- 2,000개 이상의 기성 음성 라이브러리: 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 등 지역별 방언을 포함합니다.
- 30초 샘플 기반 음성 복제: 30초 분량의 음성 샘플과 발화자 구두 동의 인증 절차를 거쳐 일관된 음성 프로필을 생성합니다.
- 각본 기반 연출 제어: `<laughs>`, `<sigh>`, `<gasp>` 같은 비언어적 표현이나 `|mhm|`, `|yeah|` 같은 맞장구(Backchanneling)를 대본에 삽입하여 타이밍과 감정을 줄 단위로 제어합니다.
구글 딥마인드는 이번에 공개된 모든 오디오 및 비디오 생성 결과물에 비가시성 디지털 워터마크인 SynthID와 C2PA 자격 증명을 적용하여 AI 생성 콘텐츠의 투명성과 안전성을 보장하고 있습니다.