구글 제미나이 3.8 생태계 확장과 에이전틱 AI 진화

구글 딥마인드가 제미나이 3.8 플래시와 사이버 전용 모델을 포함해 음성 대화형 모델인 3.8 라이브 라인업을 공개했습니다. 또한 비디오 제어 기능을 강화한 옴니 1.1 플래시와 토큰 소모를 최대 88% 줄여주는 에이전틱 비디오 이해 기술을 발표했습니다. 개발자는 웹소켓 양방향 API와 AI 스튜디오를 통해 고성능 에이전트 환경을 저비용으로 구축할 수 있습니다.

6주 만의 세 번째 릴리스: 제미나이 3.8 플래시와 보안 특화 모델의 등장

구글 딥마인드가 3.7 플래시 출시 이후 3주 만에 차세대 모델인 Gemini 3.8 Flash와 사이버 보안 특화 모델인 Gemini 3.8 Flash Cyber를 공식 발표했습니다. 제미나이 3.8 플래시는 소프트웨어 엔지니어링, 에이전트 작업, 다단계 추론 성능을 대폭 끌어올리면서도 3.7 플래시와 동일한 가격(입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75)을 유지합니다.

  1. 작업 입력
  2. 심층 다단계 추론
  3. 도구 반복 호출
  4. 검증 및 결과 반환

제미나이 3.8 플래시는 복잡한 작업에서 추가 추론 단계를 거치고 도구를 반복적으로 호출하는 '딜리전스(diligence)' 메커니즘을 적용했습니다. HLE-Verified 벤치마크에서 54.9%를 기록했으며, 장기 엔지니어링 벤치마크인 DeepSWE v1.1과 금융(Vals Finance Agent V2), 법률(Harvey Legal Agent) 등 전문 영역에서도 높은 성과를 냈습니다.

함께 공개된 Gemini 3.8 Flash Cyber는 방어자를 위한 취약점 탐지 및 자동 패치 모델로, Fairwind Program을 통해 공공기관 및 핵심 인프라 운영자에게 우선 제공됩니다.

모델/솔루션주요 용도핵심 벤치마크 지표공급 경로
Gemini 3.8 Flash범용 에이전트 및 코딩HLE-Verified 54.9%Gemini API, Google AI Studio, Gemini Enterprise
Gemini 3.8 Flash Cyber취약점 분석 및 패치20개 언어 탐지율 >70%, CWE-Bench 47.2%Fairwind Program (승인된 파트너)

실제 내부 테스트에서 크롬 보안팀은 3.8 플래시 사이버가 기존 상용 대형 모델 대비 2.6배 더 많은 취약점 패치를 성공시켰다고 밝혔습니다. 보안 기업 Wiz의 침투 테스트 벤치마크에서는 대형 모델 대비 비용을 2.3~5.2배 절감하면서도 재현율(Recall)을 7.5~9.7% 향상시켰습니다. 구글 클라우드 연구팀 역시 수개월이 소요되던 핵심 취약점을 2시간 미만에 식별하는 성과를 거두었습니다.

음성과 추론의 병렬 처리: 제미나이 3.8 라이브

대화형 음성 AI 영역에서는 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking이 새롭게 공개되었습니다. 3.8 라이브는 97개 언어 감지 및 전환을 지원하며, 사용자의 말을 끊지 않고 백그라운드에서 API 도구를 실행합니다. 3.8 라이브 익스텐디드 싱킹은 음성을 내보내면서 동시에 다단계 추론을 수행하는 동시 처리 구조를 갖췄습니다.

Speech to Speech Index82.6
tau-Voice68.6
Big Bench Audio97.7

벤치마크 성능을 살펴보면 3.8 라이브 익스텐디드 싱킹은 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 1위를 기록했으며, $\tau$-Voice에서 68.6%, $\tau$-Voice-banking에서 35.1%, Big Bench Audio에서 97.7%를 달성했습니다.

독립 개발자 사이먼 윌리슨(Simon Willison)의 분석에 따르면, 제미나이 라이브는 별도 라이브러리 없이 표준 WebSockets 프로토콜(`wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent`)과 Web Audio API AudioContext를 통해 브라우저에서 직접 양방향 스트리밍 음성 대화를 구현할 수 있습니다. 생성된 모든 오디오에는 워터마크 기술인 SynthID가 내장됩니다.

미디어 생성의 정밀 제어: 옴니 1.1 플래시

영상 생성 모델인 Gemini Omni 1.1 Flash는 제작 현장에서 필요한 제어 도구를 대폭 강화했습니다.

이 모델은 현재 Adobe Firefly, Figma Weave, Runway, GMI Cloud 등 주요 크리에이티브 플랫폼에 연동되어 프로덕션 워크플로우에 투입되고 있습니다.

에이전틱 비디오 이해: 토큰 88% 절감 기술

마지막으로 구글은 동영상 분석 효율을 극대화하는 에이전틱 비디오 이해(Agentic Video Understanding) 기능을 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트에 적용했습니다.

"Unlike current 'static' processing, where the model ingests the video at a fixed frames-per-second rate, agentic video understanding pairs the model's core reasoning with native video tools to dynamically search, scan, and inspect target video segments..."

기존의 고정 프레임 레이트(1 FPS) 방식과 달리, 에이전트 루프를 통해 필요한 구간의 프레임 레이트를 동적으로 조절하고 음성 및 트랜스크립트를 능동적으로 탐색합니다. 이를 통해 표준 벤치마크 기준 분석 비용을 최대 66%, 토큰 소비량을 최대 88% 감축하면서도 정확도를 최대 7% 개선했습니다. 이 기술은 향후 유튜브의 'Ask YouTube' 기능에도 적용될 예정입니다.

確認された数値

編集部の見解

구글의 이번 릴리스는 단순 파라미터 확장이 아닌 에이전트 실행 효율화와 도메인 특화(보안·음성·비디오)에 집중하고 있습니다. 특히 고정 토큰 소모를 줄이는 동적 비디오 탐색과 동일 가격대의 추론량 확장은 엔터프라이즈 AI 도입 비용(TCO) 구조에 큰 변화를 가져올 것으로 전망됩니다.

未確認の点

記事で言及されたモデル

プロバイダー入力出力コンテキスト長
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

出典

カタログへ