구글 제미나이 3.8 패밀리 전격 공개: 멀티모달 에이전트와 오디오 혁신

구글 딥마인드가 제미나이 3.8 플래시, 라이브, 라이브 아바타, 차세대 TTS 모델 라인업을 일제히 공개했습니다. 실시간 음성 대화 중 도구를 백그라운드로 호출하는 비동기 연산과 97개 언어 실시간 립싱크 아바타 기술이 전면에 배치되었습니다. 또한 취약점 탐지 성공률 70%를 돌파한 보안 특화 모델과 프롬프트 기반 음성 디자인 스튜디오를 함께 지원합니다. 이로써 텍스트 중심 에이전트에서 실시간 시청각 상호작용 및 실무 엔지니어링 에이전트로의 전면적인 전환이 가속화되고 있습니다.

6주간 3회 연속 릴리스: 제미나이 3.8 패밀리의 전면적 확장

구글 딥마인드가 Gemini 3.8 라인업을 대거 공개하며 멀티모달 실시간 에이전트 생태계의 판도를 재편하고 있습니다. 이번 발표는 3.7 Flash 공개 이후 3주 만에 단행되었으며, 불과 6주 만에 세 번째 플래시 모델을 선보이는 가파른 개발 속도를 증명했습니다. 제미나이 3.8 패밀리는 경량화 추론 엔진인 Gemini 3.8 Flash, 사이버 보안 전용 방어 모델인 Gemini 3.8 Flash Cyber, 실시간 음성 상호작용을 담당하는 Gemini 3.8 Live 및 Gemini 3.8 Live Extended Thinking, 시각적 페르소나를 결합한 Gemini 3.8 Live with Live Avatar, 그리고 정교한 음성 연출이 가능한 Gemini 3.8 Flash TTS 및 Flash-Lite TTS로 구성됩니다.

  1. 실시간 시청각 입력
  2. 백그라운드 비동기 도구 연산
  3. 실시간 다국어 음성 생성
  4. 시각적 아바타 립싱크 출력

플래시 모델의 진화: 장기 코딩과 사이버 보안 특화

Gemini 3.8 Flash는 이전 세대인 3.7 Flash와 동일한 가격인 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75의 시작 가격을 유지하면서 소프트웨어 엔지니어링 및 자율 에이전트 추론 역량을 대폭 끌어올렸습니다. 장기 지속 소프트웨어 엔지니어링 벤치마크인 DeepSWE v1.1에서 대형 프론티어 모델들을 능가하는 성과를 거두었으며, 다학제 추론 벤치마크인 HLE-Verified에서 54.9%를 기록했습니다. 이와 함께 정량 분석 및 법률 분야를 측정하는 Vals Finance Agent V2와 Harvey's Legal Agent Benchmark에서도 기존 3.7 Flash 대비 우수한 성적을 냈습니다.

엔터프라이즈 방어를 위한 Gemini 3.8 Flash Cyber

공동 출시된 Gemini 3.8 Flash Cyber는 신뢰받는 보안 방어자들을 위한 전용 프로그램인 Fairwind Program을 통해 제공됩니다. 공격(Exploitation)보다는 방어 및 패치 생성에 초점을 맞추어 훈련되었습니다.

평가 지표 및 벤치마크Gemini 3.8 Flash Cyber 성과비교 대상 및 기준
20개 언어 내부 취약점 벤치마크70% 초과내부 이전 세대 모델 대비 대폭 향상
CWE-Bench (패치 능력)47.2% (pass@1)선도 프론티어 모델 (47.8%) 대등 수준
Chrome 취약점 수정2.6배 더 많은 정확한 패치 생성상용 대형 모델 대비 우위
Wiz 모의침투 벤치마크+7.5~9.7% 재현율 향상2.3~5.2배 낮은 비용으로 달성

실제로 구글 클라우드 취약점 연구팀은 연구에 수개월이 소요되던 중대한 기반 취약점을 Gemini 3.8 Flash Cyber를 활용해 2시간 미만 만에 찾아냈습니다.

실시간 음성 에이전트와 비동기 병렬 연산

Gemini 3.8 Live 제품군은 대화 중단을 없앤 실시간 상호작용에 집중합니다. Gemini 3.8 Live Extended Thinking 모델은 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 전체 1위를 차지했으며, 에이전트 작업 완료도 벤치마크인 $\tau$-Voice에서 68.6%, $\tau$-Voice-banking에서 35.1%로 선두를 기록했습니다. Big Bench Audio 추론 지표에서도 97.7%를 달성했습니다.

"Gemini 3.8 Live Extended Thinking은 대화 흐름을 방해하지 않으면서 심층 추론과 음성 발화를 동시에 수행합니다. '확인해 보겠습니다'와 같은 초기 언어 단서를 활용해 요청을 인지하고, 백그라운드 작업 진행 상황을 실시간으로 중계합니다."

이들 모델은 대화 도중 97개 언어를 자동으로 감지하여 전환하며, 대화를 멈추지 않고 백그라운드에서 API 및 도구를 비동기 호출합니다. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 등의 개발자 플랫폼과 연동되어 실시간 미디어 스트리밍 인프라를 지원합니다.

Live Avatar: 97개 언어 실시간 립싱크와 시각적 페르소나

Gemini 3.8 Live with Live Avatar는 라이브 대화 모델에 저지연 스트리밍 비디오 생성을 결합하여 Gemini Enterprise 고객에게 제공됩니다. 사용자의 시각 및 오디오 입력을 실시간으로 처리하며, 동적 비주얼 페르소나를 통해 미세한 표정과 립싱크를 구현합니다.

텍스트-투-스피치(TTS) 스튜디오와 창작 제어권

음성 생성 제품군으로는 Gemini 3.8 Flash TTS와 대량 처리에 최적화된 Gemini 3.8 Flash-Lite TTS가 출시되었습니다. 이 모델들은 Hume AI의 Voice Design Benchmark에서 71.4점, 액센트 모델링에서 60.8점을 기록하며 전체 1위에 올랐습니다.

Voice Design (Flash TTS)71.4
Accent Modeling (Flash TTS)60.8
S2S Quality (Live ET)82.6
Big Bench Audio (Live ET)97.7

구글 딥마인드는 이번에 공개된 모든 오디오 및 비디오 생성 결과물에 비가시성 디지털 워터마크인 SynthID와 C2PA 자격 증명을 적용하여 AI 생성 콘텐츠의 투명성과 안전성을 보장하고 있습니다.

已核实数据

我们的观点

구글이 모델의 추론 지능뿐 아니라 비동기 도구 연산과 비디오·음성 렌더링 파이프라인을 일체화함으로써 실시간 인터랙티브 AI의 기준점을 한 단계 끌어올렸습니다. 특히 텍스트 지시문 기반의 음성 및 시각 페르소나 제어 기능은 엔터프라이즈 고객 응대와 콘텐츠 제작 산업의 비용 구조를 근본적으로 바꿀 잠재력이 큽니다. 다만 실제 엔터프라이즈 환경에서의 대규모 동시 접속 지연 시간 방어와 엄격한 보안 컴플라이언스 유지가 광범위한 도입의 실질적 척도가 될 것입니다.

尚未确认

文中提及的模型

供应商输入输出上下文窗口
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

来源

返回目录