6주 만의 세 번째 릴리스: 제미나이 3.8 플래시와 보안 특화 모델의 등장
구글 딥마인드가 3.7 플래시 출시 이후 3주 만에 차세대 모델인 Gemini 3.8 Flash와 사이버 보안 특화 모델인 Gemini 3.8 Flash Cyber를 공식 발표했습니다. 제미나이 3.8 플래시는 소프트웨어 엔지니어링, 에이전트 작업, 다단계 추론 성능을 대폭 끌어올리면서도 3.7 플래시와 동일한 가격(입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75)을 유지합니다.
- 작업 입력
- 심층 다단계 추론
- 도구 반복 호출
- 검증 및 결과 반환
제미나이 3.8 플래시는 복잡한 작업에서 추가 추론 단계를 거치고 도구를 반복적으로 호출하는 '딜리전스(diligence)' 메커니즘을 적용했습니다. HLE-Verified 벤치마크에서 54.9%를 기록했으며, 장기 엔지니어링 벤치마크인 DeepSWE v1.1과 금융(Vals Finance Agent V2), 법률(Harvey Legal Agent) 등 전문 영역에서도 높은 성과를 냈습니다.
함께 공개된 Gemini 3.8 Flash Cyber는 방어자를 위한 취약점 탐지 및 자동 패치 모델로, Fairwind Program을 통해 공공기관 및 핵심 인프라 운영자에게 우선 제공됩니다.
| 모델/솔루션 | 주요 용도 | 핵심 벤치마크 지표 | 공급 경로 |
|---|---|---|---|
| Gemini 3.8 Flash | 범용 에이전트 및 코딩 | HLE-Verified 54.9% | Gemini API, Google AI Studio, Gemini Enterprise |
| Gemini 3.8 Flash Cyber | 취약점 분석 및 패치 | 20개 언어 탐지율 >70%, CWE-Bench 47.2% | Fairwind Program (승인된 파트너) |
실제 내부 테스트에서 크롬 보안팀은 3.8 플래시 사이버가 기존 상용 대형 모델 대비 2.6배 더 많은 취약점 패치를 성공시켰다고 밝혔습니다. 보안 기업 Wiz의 침투 테스트 벤치마크에서는 대형 모델 대비 비용을 2.3~5.2배 절감하면서도 재현율(Recall)을 7.5~9.7% 향상시켰습니다. 구글 클라우드 연구팀 역시 수개월이 소요되던 핵심 취약점을 2시간 미만에 식별하는 성과를 거두었습니다.
음성과 추론의 병렬 처리: 제미나이 3.8 라이브
대화형 음성 AI 영역에서는 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking이 새롭게 공개되었습니다. 3.8 라이브는 97개 언어 감지 및 전환을 지원하며, 사용자의 말을 끊지 않고 백그라운드에서 API 도구를 실행합니다. 3.8 라이브 익스텐디드 싱킹은 음성을 내보내면서 동시에 다단계 추론을 수행하는 동시 처리 구조를 갖췄습니다.
| Speech to Speech Index | 82.6 |
| tau-Voice | 68.6 |
| Big Bench Audio | 97.7 |
벤치마크 성능을 살펴보면 3.8 라이브 익스텐디드 싱킹은 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 1위를 기록했으며, $\tau$-Voice에서 68.6%, $\tau$-Voice-banking에서 35.1%, Big Bench Audio에서 97.7%를 달성했습니다.
독립 개발자 사이먼 윌리슨(Simon Willison)의 분석에 따르면, 제미나이 라이브는 별도 라이브러리 없이 표준 WebSockets 프로토콜(`wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent`)과 Web Audio API AudioContext를 통해 브라우저에서 직접 양방향 스트리밍 음성 대화를 구현할 수 있습니다. 생성된 모든 오디오에는 워터마크 기술인 SynthID가 내장됩니다.
미디어 생성의 정밀 제어: 옴니 1.1 플래시
영상 생성 모델인 Gemini Omni 1.1 Flash는 제작 현장에서 필요한 제어 도구를 대폭 강화했습니다.
- 장면 확장(Scene Extension): 이전 10초 분량의 컨텍스트를 분석하여 일관성을 유지한 채 최대 40초까지 연속 영상을 생성합니다.
- 시작 및 종료 프레임 보간(Keyframe Interpolation): 첫 프레임과 끝 프레임을 지정하여 카메라 워크(줌, 패닝, 360도 회전)를 매끄럽게 연결합니다.
- 360p 고속 프리뷰: 표준 720p 대비 비용을 3분의 1 수준으로 낮추고 생성 속도를 최대 60% 단축하여 신속한 프로토타이핑을 지원합니다.
- 고해상도 업스케일링: 최종 결과물을 1080p 및 4K 해상도로 출력합니다.
- 비디오 참조(Multimodal References): 최대 3초 분량의 참조 영상을 입력받아 캐릭터 및 시각적 일관성을 유지합니다.
이 모델은 현재 Adobe Firefly, Figma Weave, Runway, GMI Cloud 등 주요 크리에이티브 플랫폼에 연동되어 프로덕션 워크플로우에 투입되고 있습니다.
에이전틱 비디오 이해: 토큰 88% 절감 기술
마지막으로 구글은 동영상 분석 효율을 극대화하는 에이전틱 비디오 이해(Agentic Video Understanding) 기능을 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트에 적용했습니다.
"Unlike current 'static' processing, where the model ingests the video at a fixed frames-per-second rate, agentic video understanding pairs the model's core reasoning with native video tools to dynamically search, scan, and inspect target video segments..."
기존의 고정 프레임 레이트(1 FPS) 방식과 달리, 에이전트 루프를 통해 필요한 구간의 프레임 레이트를 동적으로 조절하고 음성 및 트랜스크립트를 능동적으로 탐색합니다. 이를 통해 표준 벤치마크 기준 분석 비용을 최대 66%, 토큰 소비량을 최대 88% 감축하면서도 정확도를 최대 7% 개선했습니다. 이 기술은 향후 유튜브의 'Ask YouTube' 기능에도 적용될 예정입니다.