구글 Gemini 3.8 전면 공개: 실시간 아바타부터 사이버 보안까지 에이전트 혁신

구글 딥마인드가 실시간 멀티모달 대화와 자율 에이전트 기능을 대폭 강화한 'Gemini 3.8' 제품군을 일제히 공개했습니다. 실시간 비디오 페르소나를 결합한 Live Avatar와 심층 음성 추론을 지원하는 3.8 Live Extended Thinking, 코딩 및 도메인 분석에 특화된 3.8 Flash 및 사이버 보안 전용 3.8 Flash Cyber, 그리고 정밀 연출이 가능한 생성형 TTS 모델까지 포함되었습니다. 대화 중단 없는 백그라운드 도구 실행, 97개 이상 다국어 실시간 동기화, SynthID 기반 위변조 방지 워터마크 기술이 전반에 적용되었습니다.

차세대 멀티모달 인터랙션의 진화: 비디오와 음성을 통합한 'Live Avatar'

구글 딥마인드가 네이티브 실시간 대화 모델에 저지연 스트리밍 비디오 생성을 결합한 Gemini 3.8 Live with Live Avatar를 발표했습니다. 해당 모델은 시각 정보와 오디오 입력을 동시에 수신하여 사용자와 실시간으로 듣고 보고 말하는 비주얼 대화 페르소나를 구현합니다. 정밀한 립싱크와 자연스러운 표정 변화, 유연한 턴테이킹(Turn-taking)을 바탕으로 고객 서비스나 대화형 가이드 등 기업용 에이전트 환경을 지원합니다.

  1. 사용자 음성/영상 입력
  2. 실시간 멀티모달 인지
  3. 백그라운드 비동기 도구 실행
  4. 동기화된 아바타·음성 반응

Live Avatar의 핵심은 대화의 연속성을 훼손하지 않는 백그라운드 비동기 도구 호출(Asynchronous tool calling)입니다. 호텔 체크인과 같은 복잡한 비즈니스 워크플로를 처리할 때 시스템이 백그라운드에서 데이터를 조회하고 외부 API를 실행하는 동안에도 아바타는 끊김 없이 사용자와 음성 대화를 지속합니다.

---

음성 에이전트의 이중화: 초저지연 '3.8 Live'와 다단계 추론 'Extended Thinking'

구글은 실시간 음성 상호작용의 요구 조건에 맞춰 역할을 세분화한 두 가지 음성 대화 모델인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 함께 선보였습니다. 3.8 Live는 비용 효율성과 대규모 확장에 최적화되었으며, 3.8 Live Extended Thinking은 다단계 복잡 추론 및 에이전트 워크플로 수행을 위해 설계되었습니다.

"Gemini 3.8 Live Extended Thinking은 대화의 흐름을 끊지 않으면서 추론과 발화를 동시에 수행하며, '확인해 보겠습니다'와 같은 초기 언어 단서와 진행 상황 실시간 내레이션을 제공합니다."

두 모델은 글로벌 벤치마크 평가에서 뛰어난 성과를 기록했습니다. 3.8 Live Extended Thinking은 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 종합 1위를 차지했으며, 에이전트 작업 완료도 벤치마크인 τ-Voice에서 68.6%, Sierra의 τ-Voice-banking에서 35.1%를 기록했습니다. Big Bench Audio에서는 97.7%의 높은 추론 정확도를 보였습니다. 3.8 Live 모델 역시 Speech Agent Arena 2위에 올랐으며, ServiceNow의 EVA-Bench에서 정확도와 대화 품질 간의 파레토 프론티어(Pareto Frontier)를 갱신했습니다.

모델명주요 특화 영역핵심 벤치마크 지표배포 환경
Gemini 3.8 Live고속 대화, 비용 효율성, 규모 확장Speech Agent Arena 2위Search Live, Gemini API, AI Studio
Gemini 3.8 Live Extended Thinking다단계 병렬 추론, 복합 워크플로Speech-to-Speech 82.6 / τ-Voice 68.6%Workspace(Docs, Gmail, Keep), Enterprise
Gemini 3.8 Flash장기 코딩, 자율 에이전트HLE-Verified 54.9% / 1M 토큰 $0.75Gemini API, Google Antigravity, Sheets
Gemini 3.8 Flash Cyber취약점 탐지 및 자동 패치CWE-Bench pass@1 47.2%Fairwind Program (승인된 방어자)

이들 모델은 Google Workspace의 Docs Live, Gmail Live, Keep Live뿐만 아니라 Search Live 및 Gemini 앱의 데일리 브리핑 기능에 통합되어 사용자의 음성 지시를 직접 실행합니다.

---

고성능 추론과 보안의 특화: Gemini 3.8 Flash와 3.8 Flash Cyber

구글은 3.7 Flash 출시 3주 만이자 6주 만에 3번째 Flash 모델인 Gemini 3.8 Flash와 보안 특화 버전인 Gemini 3.8 Flash Cyber를 공개했습니다. 3.8 Flash는 입력 백만 토큰당 0.75달러, 출력 백만 토큰당 3.75달러라는 3.7 Flash와 동일한 가격대를 유지하면서 추론 및 엔지니어링 능력을 대폭 끌어올렸습니다.

3.8 Flash는 소프트웨어 공학 벤치마크인 DeepSWE v1.1과 정량 분석 벤치마크인 Vals Finance Agent V2, 법률 분야의 Harvey Legal Agent Benchmark에서 성능 향상을 입증했습니다. 다학제 복합 추론 평가 지표인 HLE-Verified에서는 54.9%를 기록했습니다. 이 모델은 복잡한 문제 해결 시 추가 추론 단계를 거치고 도구를 반복적으로 호출하도록 설계되어 보다 깊이 있는 연산을 수행합니다.

보안 전용 모델 'Flash Cyber'와 방어자 지원 체계

함께 공개된 Gemini 3.8 Flash Cyber는 공격용 익스플로잇보다 취약점 탐지 및 패치 자동화에 집중한 모델입니다. 주요 성과는 다음과 같습니다.

구글은 해당 모델을 정부 기관, 중요 인프라 운영자, 주요 오픈소스 소프트웨어 관리자로 구성된 신뢰 방어자 네트워크 'Fairwind Program'을 통해 우선 배포합니다.

---

정밀 연출과 맞춤형 음성 제작: Gemini 3.8 Flash TTS 제품군

음성 합성 분야에서는 정교한 연출이 가능한 Gemini 3.8 Flash TTS와 대량 배포에 최적화된 Gemini 3.8 Flash-Lite TTS가 발표되었습니다. 정적 프리셋 중심의 음성 생성을 넘어 자연어 프롬프트를 통해 캐릭터 음성을 설계하는 스튜디오 수준의 제어력을 제공합니다.

Speech-to-Speech82.6
Hume Voice Design71.4
τ-Voice68.6
HLE-Verified54.9

3.8 Flash TTS는 Hume AI의 Voice Design Benchmark에서 71.4점으로 1위를 기록했으며 악센트 모델링 부문에서도 60.8점을 기록했습니다. 2,000개 이상의 프로덕션 음성 라이브러리를 갖추었으며, 사용자가 권리를 보유한 30초 길이의 음성 샘플과 구두 동의 녹음(Verbal consent recording)을 제출하면 신원 검증 절차를 거쳐 보이스 프로필을 복제할 수 있습니다. 복제 및 생성된 음성에는 C2PA 인증 정보와 SynthID 워터마크가 기본 적용됩니다.

실제 개발자 테스트 사례에서도 높은 효율성이 입증되었습니다. 개발자 Simon Willison이 Claude 4.5 Opus와 GPT-6 Astra를 활용해 구축한 테스트 환경에 따르면, Gemini 3.8 Flash TTS API를 사용해 두 개 화자의 1분 18초 분량 대화 오디오를 생성하는 데 약 20초가 소요되었으며 소모 비용은 2.74센트 수준이었습니다.

각본 기반 연출 기능은 `<laughs>`, `<sigh>`, `<gasp>`와 같은 비언어적 음향 표현 및 `|mhm|`, `|yeah|` 등의 맞춤형 맞장구(Backchanneling) 제어를 지원하여 오디오북, 팟캐스트, 게임 대사 제작 전반에서 화자 간 자연스러운 턴테이킹을 연출할 수 있도록 돕습니다.

---

엔터프라이즈와 개발자를 아우르는 실시간 미디어 인프라 생태계

구글은 이번 모델군을 Gemini API 및 Google AI Studio뿐만 아니라 주요 실시간 미디어 스트리밍 인프라 파트너 생태계에 즉각 연동했습니다. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 등의 플랫폼이 백엔드 미디어 파이프라인 처리를 지원하며, Salesforce, Figma, HeyGen, Linguana, Wondercraft 등의 엔터프라이즈 기업들이 현지화 더빙 및 고객 대응 에이전트에 기술을 통합하고 있습니다.

결과적으로 Gemini 3.8 라인업은 실시간 영상 페르소나(Live Avatar), 심층 추론형 음성 에이전트(3.8 Live Extended Thinking), 고속 코드 및 보안 추론(3.8 Flash/Cyber), 감정 제어형 음성 합성(3.8 Flash TTS)을 하나의 유기적 파이프라인으로 묶어 내며 자율형 AI 에이전트 아키텍처의 기준점을 제시하고 있습니다.

Verified figures

Our take

구글은 단일 텍스트 모델 간의 지능 대결을 넘어 실시간 영상 생성, 음성 추론, 도메인 보안 패치, 오디오 제어를 아우르는 '완전체 멀티모달 에이전트' 인프라 선점에 집중하고 있습니다. 특히 Flash 라인업의 파격적인 가격 구조를 유지하면서 고난도 다단계 추론과 비동기 백그라운드 툴 실행을 표준화한 것은 엔터프라이즈 도입의 경제적 장벽을 크게 낮출 것으로 평가됩니다.

Open questions

Models mentioned

ProviderInputOutputContext window
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

Source

Back to catalog