차세대 멀티모달 인터랙션의 진화: 비디오와 음성을 통합한 'Live Avatar'
구글 딥마인드가 네이티브 실시간 대화 모델에 저지연 스트리밍 비디오 생성을 결합한 Gemini 3.8 Live with Live Avatar를 발표했습니다. 해당 모델은 시각 정보와 오디오 입력을 동시에 수신하여 사용자와 실시간으로 듣고 보고 말하는 비주얼 대화 페르소나를 구현합니다. 정밀한 립싱크와 자연스러운 표정 변화, 유연한 턴테이킹(Turn-taking)을 바탕으로 고객 서비스나 대화형 가이드 등 기업용 에이전트 환경을 지원합니다.
- 사용자 음성/영상 입력
- 실시간 멀티모달 인지
- 백그라운드 비동기 도구 실행
- 동기화된 아바타·음성 반응
Live Avatar의 핵심은 대화의 연속성을 훼손하지 않는 백그라운드 비동기 도구 호출(Asynchronous tool calling)입니다. 호텔 체크인과 같은 복잡한 비즈니스 워크플로를 처리할 때 시스템이 백그라운드에서 데이터를 조회하고 외부 API를 실행하는 동안에도 아바타는 끊김 없이 사용자와 음성 대화를 지속합니다.
- 97개 언어 실시간 적응: 대화 중간에 언어가 바뀌더라도 비디오 품질 저하나 시각적 왜곡(Visual drift) 없이 립싱크와 표정을 97개 언어에 걸쳐 원활하게 동기화합니다.
- 기업 맞춤형 커스텀 아바타: 단 한 장의 고품질 참조 이미지를 바탕으로 브랜드 정체성을 유지하는 반응형 애니메이션 아바타 생성이 가능하며, 현재 엔터프라이즈 화이트리스트를 통해 제공됩니다.
- SynthID 워터마킹 적용: 생성된 모든 오디오 및 비디오 출력에 비가시성 디지털 워터마크를 결합하여 AI 생성 콘텐츠의 투명성과 추적성을 확보했습니다.
---
음성 에이전트의 이중화: 초저지연 '3.8 Live'와 다단계 추론 'Extended Thinking'
구글은 실시간 음성 상호작용의 요구 조건에 맞춰 역할을 세분화한 두 가지 음성 대화 모델인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 함께 선보였습니다. 3.8 Live는 비용 효율성과 대규모 확장에 최적화되었으며, 3.8 Live Extended Thinking은 다단계 복잡 추론 및 에이전트 워크플로 수행을 위해 설계되었습니다.
"Gemini 3.8 Live Extended Thinking은 대화의 흐름을 끊지 않으면서 추론과 발화를 동시에 수행하며, '확인해 보겠습니다'와 같은 초기 언어 단서와 진행 상황 실시간 내레이션을 제공합니다."
두 모델은 글로벌 벤치마크 평가에서 뛰어난 성과를 기록했습니다. 3.8 Live Extended Thinking은 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 종합 1위를 차지했으며, 에이전트 작업 완료도 벤치마크인 τ-Voice에서 68.6%, Sierra의 τ-Voice-banking에서 35.1%를 기록했습니다. Big Bench Audio에서는 97.7%의 높은 추론 정확도를 보였습니다. 3.8 Live 모델 역시 Speech Agent Arena 2위에 올랐으며, ServiceNow의 EVA-Bench에서 정확도와 대화 품질 간의 파레토 프론티어(Pareto Frontier)를 갱신했습니다.
| 모델명 | 주요 특화 영역 | 핵심 벤치마크 지표 | 배포 환경 |
|---|---|---|---|
| Gemini 3.8 Live | 고속 대화, 비용 효율성, 규모 확장 | Speech Agent Arena 2위 | Search Live, Gemini API, AI Studio |
| Gemini 3.8 Live Extended Thinking | 다단계 병렬 추론, 복합 워크플로 | Speech-to-Speech 82.6 / τ-Voice 68.6% | Workspace(Docs, Gmail, Keep), Enterprise |
| Gemini 3.8 Flash | 장기 코딩, 자율 에이전트 | HLE-Verified 54.9% / 1M 토큰 $0.75 | Gemini API, Google Antigravity, Sheets |
| Gemini 3.8 Flash Cyber | 취약점 탐지 및 자동 패치 | CWE-Bench pass@1 47.2% | Fairwind Program (승인된 방어자) |
이들 모델은 Google Workspace의 Docs Live, Gmail Live, Keep Live뿐만 아니라 Search Live 및 Gemini 앱의 데일리 브리핑 기능에 통합되어 사용자의 음성 지시를 직접 실행합니다.
---
고성능 추론과 보안의 특화: Gemini 3.8 Flash와 3.8 Flash Cyber
구글은 3.7 Flash 출시 3주 만이자 6주 만에 3번째 Flash 모델인 Gemini 3.8 Flash와 보안 특화 버전인 Gemini 3.8 Flash Cyber를 공개했습니다. 3.8 Flash는 입력 백만 토큰당 0.75달러, 출력 백만 토큰당 3.75달러라는 3.7 Flash와 동일한 가격대를 유지하면서 추론 및 엔지니어링 능력을 대폭 끌어올렸습니다.
3.8 Flash는 소프트웨어 공학 벤치마크인 DeepSWE v1.1과 정량 분석 벤치마크인 Vals Finance Agent V2, 법률 분야의 Harvey Legal Agent Benchmark에서 성능 향상을 입증했습니다. 다학제 복합 추론 평가 지표인 HLE-Verified에서는 54.9%를 기록했습니다. 이 모델은 복잡한 문제 해결 시 추가 추론 단계를 거치고 도구를 반복적으로 호출하도록 설계되어 보다 깊이 있는 연산을 수행합니다.
보안 전용 모델 'Flash Cyber'와 방어자 지원 체계
함께 공개된 Gemini 3.8 Flash Cyber는 공격용 익스플로잇보다 취약점 탐지 및 패치 자동화에 집중한 모델입니다. 주요 성과는 다음과 같습니다.
- CWE-Bench 패치 성능: 47.2%의 pass@1을 달성하여 최상위 프론티어 모델(47.8%)에 근접한 방어 역량을 확인했습니다.
- 20개 프로그래밍 언어 취약점 탐지: 구글 내부 다국어 코드베이스 벤치마크에서 70% 이상의 성공률을 기록했습니다.
- 구글 및 파트너 실증 결과: 크롬 보안팀 평가에서 기존 대형 상용 모델 대비 2.6배 더 정확한 취약점 패치를 생성했습니다. 클라우드 취약점 연구팀은 통상 수개월이 소요되던 중대 기반 취약점을 2시간 미만에 탐지했습니다. 클라우드 보안 기업 Wiz의 침투 테스트에서는 선도 모델 대비 2.3~5.2배 낮은 비용으로 7.5~9.7% 더 높은 재현율(Recall)을 달성했습니다.
구글은 해당 모델을 정부 기관, 중요 인프라 운영자, 주요 오픈소스 소프트웨어 관리자로 구성된 신뢰 방어자 네트워크 'Fairwind Program'을 통해 우선 배포합니다.
---
정밀 연출과 맞춤형 음성 제작: Gemini 3.8 Flash TTS 제품군
음성 합성 분야에서는 정교한 연출이 가능한 Gemini 3.8 Flash TTS와 대량 배포에 최적화된 Gemini 3.8 Flash-Lite TTS가 발표되었습니다. 정적 프리셋 중심의 음성 생성을 넘어 자연어 프롬프트를 통해 캐릭터 음성을 설계하는 스튜디오 수준의 제어력을 제공합니다.
| Speech-to-Speech | 82.6 |
| Hume Voice Design | 71.4 |
| τ-Voice | 68.6 |
| HLE-Verified | 54.9 |
3.8 Flash TTS는 Hume AI의 Voice Design Benchmark에서 71.4점으로 1위를 기록했으며 악센트 모델링 부문에서도 60.8점을 기록했습니다. 2,000개 이상의 프로덕션 음성 라이브러리를 갖추었으며, 사용자가 권리를 보유한 30초 길이의 음성 샘플과 구두 동의 녹음(Verbal consent recording)을 제출하면 신원 검증 절차를 거쳐 보이스 프로필을 복제할 수 있습니다. 복제 및 생성된 음성에는 C2PA 인증 정보와 SynthID 워터마크가 기본 적용됩니다.
실제 개발자 테스트 사례에서도 높은 효율성이 입증되었습니다. 개발자 Simon Willison이 Claude 4.5 Opus와 GPT-6 Astra를 활용해 구축한 테스트 환경에 따르면, Gemini 3.8 Flash TTS API를 사용해 두 개 화자의 1분 18초 분량 대화 오디오를 생성하는 데 약 20초가 소요되었으며 소모 비용은 2.74센트 수준이었습니다.
각본 기반 연출 기능은 `<laughs>`, `<sigh>`, `<gasp>`와 같은 비언어적 음향 표현 및 `|mhm|`, `|yeah|` 등의 맞춤형 맞장구(Backchanneling) 제어를 지원하여 오디오북, 팟캐스트, 게임 대사 제작 전반에서 화자 간 자연스러운 턴테이킹을 연출할 수 있도록 돕습니다.
---
엔터프라이즈와 개발자를 아우르는 실시간 미디어 인프라 생태계
구글은 이번 모델군을 Gemini API 및 Google AI Studio뿐만 아니라 주요 실시간 미디어 스트리밍 인프라 파트너 생태계에 즉각 연동했습니다. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 등의 플랫폼이 백엔드 미디어 파이프라인 처리를 지원하며, Salesforce, Figma, HeyGen, Linguana, Wondercraft 등의 엔터프라이즈 기업들이 현지화 더빙 및 고객 대응 에이전트에 기술을 통합하고 있습니다.
결과적으로 Gemini 3.8 라인업은 실시간 영상 페르소나(Live Avatar), 심층 추론형 음성 에이전트(3.8 Live Extended Thinking), 고속 코드 및 보안 추론(3.8 Flash/Cyber), 감정 제어형 음성 합성(3.8 Flash TTS)을 하나의 유기적 파이프라인으로 묶어 내며 자율형 AI 에이전트 아키텍처의 기준점을 제시하고 있습니다.