구글 제미나이 3.8 패밀리 총출동, 멀티모달 실시간 에이전트 완성

구글 딥마인드가 제미나이 3.8 플래시, 라이브 아바타, 라이브 익스텐디드 씽킹, TTS 모델 라인업을 일제히 공개했습니다. 실시간 음성 대화와 영상 아바타 렌더링, 백그라운드 도구 실행을 결합해 끊김 없는 에이전트 워크플로우를 구현했습니다. 또한 3.8 플래시 사이버를 통해 취약점 탐지 및 패치 성능을 크게 끌어올리며 산업별 실전 투입 역량을 입증했습니다.

실시간 상호작용의 시각화: 제미나이 3.8 Live와 Live Avatar의 결합

구글 딥마인드가 실시간 대화형 AI 인터페이스에 시각적 실재감을 부여하는 Gemini 3.8 Live with Live Avatar를 공개했습니다. 이 기능은 네이티브 라이브 대화 모델에 저지연 스트리밍 비디오 생성 기술을 결합하여, 사용자와 시각 및 청각적으로 상호작용하는 디지털 페르소나를 구축합니다. 라이브 아바타는 정밀한 립싱크와 자연스러운 표정 변화를 구현하며, 사용자와의 유연한 대화 턴테이킹(turn-taking)을 지원합니다.

특히 주목할 점은 대화가 진행되는 도중 끊김 없이 백그라운드에서 외부 작업을 처리하는 비동기 툴 실행(Asynchronous tool execution) 구조입니다. 대화형 AI가 호텔 체크인이나 예약 정보 조회와 같은 복잡한 백엔드 API를 호출하는 동안에도, 사용자와의 음성 및 시각적 소통은 중단 없이 유지됩니다.

  1. 음성 및 시각 입력 수신
  2. 실시간 페르소나 렌더링
  3. 비동기 백그라운드 툴 호출
  4. 연속적 대화 응답 제공

글로벌 환경을 위한 다국어 지원 역시 대폭 강화되었습니다. 3.8 Live Avatar는 별도의 비디오 품질 저하나 시각적 드리프트 없이 97개 언어 사이를 실시간으로 전환하며 입모양과 표정을 적응시킵니다. 기업은 라이브러리에 내장된 기본 아바타 외에도 단 한 장의 고품질 참조 이미지를 통해 고유한 브랜드 캐릭터를 애니메이션화할 수 있는 커스텀 아바타 기능을 엔터프라이즈 화이트리스트 형태로 제공받을 수 있습니다. 모든 오디오 및 비디오 생성물에는 악의적 오용 방지를 위한 워터마킹 기술인 SynthID가 내장됩니다.

---

병렬 추론과 음성 에이전트의 진화: Gemini 3.8 Live 모델군

구글은 고효율 대규모 배포를 위한 Gemini 3.8 Live와 고난도 다단계 추론을 전담하는 Gemini 3.8 Live Extended Thinking을 함께 선보였습니다. 이번 모델군은 실시간 음성 통신 환경에서 추론과 발화를 동시에 수행하는 병렬 처리 아키텍처를 도입했습니다.

3.8 Live Extended Thinking은 복잡한 백그라운드 작업을 실행할 때 "확인해 보겠습니다(Let me check that...)"와 같은 음성 큐를 자연스럽게 출력하고, 다단계 작업의 진행 상황을 실시간으로 중계하는 능력을 갖추었습니다. 사용자 피드백과 손그림 스케치를 바탕으로 즉석에서 React 컴포넌트를 코딩하거나, 복합 예약 프로세스를 완료하는 등의 작업이 대화 단절 없이 이뤄집니다.

음성 에이전트 벤치마크에서 기록된 주요 지표는 다음과 같습니다.

벤치마크 지표모델 및 성과 수치비고
Speech to Speech Quality IndexGemini 3.8 Live Extended Thinking: 82.6Artificial Analysis 종합 1위
τ-Voice (에이전트 태스크 완성도)Gemini 3.8 Live Extended Thinking: 68.6%전체 프런티어 모델 중 1위
τ-Voice-bankingGemini 3.8 Live Extended Thinking: 35.1%Sierra 벤치마크 선도
Big Bench AudioGemini 3.8 Live Extended Thinking: 97.7%강력한 다영역 음성 추론 증명
Speech Agent ArenaGemini 3.8 Live: 2위사용자 선호도 기반 평가
Speech to Speech Index82.6
τ-Voice Task68.6
τ-Voice Banking35.1

이들 라이브 모델은 Google Workspace(Docs, Gmail, Keep Live), Search Live, 그리고 Gemini 앱 전반에 배포되기 시작했으며, 개발자는 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 등의 연동 플랫폼을 통해 실시간 스트리밍 인프라를 손쉽게 구축할 수 있습니다.

---

초저가 추론과 방어 특화 보안: Gemini 3.8 Flash 및 Flash Cyber

3.7 Flash 출시 후 3주 만에 등장한 Gemini 3.8 Flash는 이전 버전과 동일한 가격 정책(입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75)을 유지하면서도 장기 실행 소프트웨어 엔지니어링 및 다단계 자율 에이전트 역량을 끌어올렸습니다. STEM과 인문학 등 전문 영역 전반을 측정하는 HLE-Verified 벤치마크에서 54.9%를 기록했습니다.

"3.8 Flash의 성능 향상은 단순한 매개변수 확장이 아니라 '더 성실하게 작동하도록 설계된 구조'에서 비롯됩니다. 복잡한 작업에서 추가 추론 단계를 수행하고 도구를 반복적으로 호출합니다."

동시에 공개된 Gemini 3.8 Flash Cyber는 보안 방어자를 위해 특화된 파생 모델로, 새로운 Fairwind 프로그램을 통해 제한적으로 공급됩니다. 20개 프로그래밍 언어에 걸친 구글 내부 취약점 탐지 벤치마크에서 70% 이상의 성공률을 보였으며, 오픈소스 패치 벤치마크인 CWE-Bench에서 47.2%의 pass@1을 달성했습니다.

실제 엔터프라이즈 환경에서의 적용 성과는 구체적인 수치로 확인됩니다.

---

자연어 연출과 실시간 복제: Gemini 3.8 Flash TTS 라인업

음성 생성 영역에서는 정적 프리셋을 탈피해 프롬프트로 목소리를 설계하는 Gemini 3.8 Flash TTS 및 대규모 처리에 최적화된 Gemini 3.8 Flash-Lite TTS가 발표되었습니다. 100개 이상의 언어 및 방언 지원과 함께 2,000개 이상의 상용 라이브러리 음성을 기본 제공합니다.

3.8 Flash TTS는 자연어 프롬프트 지시를 통해 캐릭터 목소리를 바닥부터 생성할 수 있으며, 단 30초의 참조 오디오 샘플만으로 발화자의 고유 음색을 복제할 수 있습니다. 무단 도용을 막기 위해 음성 소유자의 실시간 구두 동의 녹음 검증 절차와 C2PA 자격 증명, SynthID 워터마킹을 의무화했습니다.

스크립트 기반의 미세 연출 기능도 대폭 확장되었습니다. `<laughs>`, `<sigh>`, `<gasp>`와 같은 비언어적 음향 큐와 `|mhm|`, `|yeah|` 등의 추임새(backchanneling)를 단일 스크립트 내에서 통제하여 자연스러운 2인 대화 씬을 구성할 수 있습니다.

독립 개발자 사이먼 윌리슨(Simon Willison)의 실제 테스트에 따르면, GPT-6 Astra 및 Claude 4.5 Opus로 스크립트를 작성하고 Gemini 3.8 Flash TTS API를 호출했을 때 1분 18초 분량의 2인 팟캐스트 대화 오디오를 생성하는 데 약 20초가 소요되었으며, 발생한 비용은 2.74센트에 불과했습니다.

Hume AI의 Voice Design Benchmark에서 71.4점으로 1위, 악센트 모델링에서 60.8점을 기록했으며, Voice Arena 블라인드 평가에서도 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어(MSA), 멕시코 스페인어, 힌디어 등에서 최상위권을 차지했습니다.

---

산업 생태계 파급 효과와 차세대 에이전트 인프라

구글이 공개한 이번 3.8 모델 라인업은 텍스트 추론, 비동기 도구 조작, 고품질 음성 합성, 초저지연 아바타 비디오 렌더링이 단일 기술 생태계 안에서 맞물리도록 설계되었습니다. Salesforce, Genspark, Lumeris 등 글로벌 기업들이 라이브 API 채택을 공식화했으며, Figma, HeyGen, Linguana, Wondercraft 등 콘텐츠 플랫폼이 TTS 엔진을 미디어 더빙 및 인터랙티브 인터페이스에 도입하고 있습니다.

개발 인프라 측면에서는 복잡한 WebRTC 및 미디어 스트리밍 파이프라인 관리를 Agora, LiveKit, Pipecat, Vercel과 같은 서드파티 플랫폼에 위임함으로써, 엔지니어가 비즈니스 로직과 프롬프트 설계에만 집중할 수 있는 환경이 조성되었습니다. 프롬프트 인젝션 방어(Gray Swan 측정 기준)와 CBRN/사이버 오용 완화 조치가 결합된 안전 프레임워크가 적용되어 엔터프라이즈 환경에서의 안정성이 한층 보강되었습니다.

已核实数据

我们的观点

구글은 이번 발표를 통해 텍스트 모델 간 벤치마크 경쟁을 넘어 음성, 영상 아바타, 추론 백엔드가 통합된 완전한 인터랙티브 에이전트 인프라를 선점하려 하고 있습니다. 특히 실시간 대화 중에 멈추지 않고 백그라운드 툴을 호출하는 병렬 처리 아키텍처는 향후 고객 지원과 인터랙티브 소프트웨어의 UI 패러다임을 근본적으로 바꿀 잠재력이 큽니다.

尚未确认

文中提及的模型

供应商输入输出上下文窗口
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576
OpenAI: GPT-6 Astra · OpenAI$10$501,050,000

来源

返回目录