제미나이 3.8 플래시 제품군 출시: 코딩과 사이버 보안에 특화
구글 딥마인드가 제미나이 3.8 플래시(Gemini 3.8 Flash)와 사이버 보안 전용 모델인 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)를 공개했습니다. 3.7 플래시 출시 3주 만에 단행된 이번 업데이트는 에이전트 워크플로우와 장기 소프트웨어 엔지니어링 역량 강화에 초점을 맞췄습니다.
제미나이 3.8 플래시는 복잡한 태스크에서 추가적인 추론 단계를 수행하고 도구를 반복적으로 호출하는 설계 방식을 채택했습니다. 벤치마크 지표를 살펴보면 HLE-Verified에서 54.9%를 기록하며 다단계 추론 성능을 입증했습니다.
함께 공개된 제미나이 3.8 플래시 사이버는 공격적 악용보다 취약점 탐지와 자동 패치 등 방어 역량에 우선순위를 둔 모델입니다. 20개 프로그래밍 언어를 포괄하는 내부 벤치마크에서 취약점 탐지 성공률 70% 이상을 달성했으며, 외부 벤치마크인 CWE-Bench pass@1에서 47.2%를 기록해 프론티어 모델 수준의 패치 능력을 증명했습니다. 구글은 이 모델을 페어윈드 프로그램(Fairwind Program)을 통해 검증된 방어 조직과 인프라 운영자에게 선별 제공합니다.
| 모델명 | 주요 특화 영역 | 가격 (입력 / 출력, 1M 토큰 기준) | 주요 성과 지표 |
|---|---|---|---|
| Gemini 3.8 Flash | 소프트웨어 엔지니어링, 에이전트 다단계 추론 | $0.75 / $3.75 | HLE-Verified 54.9% 달성 |
| Gemini 3.8 Flash Cyber | 자율 취약점 탐지 및 자동 패치 | 전용 프로그램(Fairwind) 제공 | CWE-Bench pass@1 47.2%, 20개 언어 탐지율 70%+ |
실제 프로덕션 환경에서도 성능이 검증되었습니다. 크롬 보안팀은 대형 상용 모델 대비 2.6배 더 많은 정확한 취약점 패치를 생성했다고 밝혔으며, 위즈(Wiz)는 침투 테스트 벤치마크에서 2.3~5.2배 낮은 비용으로 +7.5~9.7% 높은 재현율(Recall)을 기록했습니다. 구글 클라우드 보안 연구팀 역시 수개월이 걸리던 핵심 기초 취약점을 2시간 미만에 찾아내는 성과를 거두었습니다.
음성 대화의 지연 없는 진화: 제미나이 3.8 라이브와 확장 추론
구글은 실시간 양방향 음성 대화를 위해 제미나이 3.8 라이브(Gemini 3.8 Live)와 제미나이 3.8 라이브 익스텐디드 씽킹(Gemini 3.8 Live Extended Thinking)을 출시했습니다. 두 모델 모두 97개 언어를 실시간으로 자동 감지하여 전환할 수 있으며, 사용자의 말을 끊지 않고 백그라운드에서 API 호출과 도구를 실행합니다.
제미나이 3.8 라이브 익스텐디드 씽킹은 말하는 도중 동시에 심층 추론을 수행하는 '동시 추론·발화' 아키텍처를 적용했습니다. 백그라운드 작업 중에는 '확인해 보겠습니다'와 같은 언어적 단서를 자연스럽게 제공하고 실시간 진행 상황을 음성으로 설명합니다.
| Speech to Speech Quality Index | 82.6 |
| Big Bench Audio | 97.7 |
| tau-Voice Task Completion | 68.6 |
| tau-Voice-banking | 35.1 |
벤치마크 측면에서 Artificial Analysis의 음성 품질 지표인 Speech to Speech Quality Index에서 82.6점으로 전체 1위를 차지했습니다. 또한 Big Bench Audio에서 97.7%, 에이전트 과업 완수 벤치마크인 τ-Voice에서 68.6%, 금융 영역인 τ-Voice-banking에서 35.1%를 기록했습니다.
개발자는 웹소켓 엔드포인트(`wss://generativelanguage.googleapis.com/ws/.../BidiGenerateContent`)를 통해 별도의 복잡한 미디어 라이브러리 없이 네이티브 Web Audio API로 실시간 양방향 오디오를 구현할 수 있습니다. 생성된 모든 오디오에는 변조 방지를 위한 신스ID(SynthID) 비가시적 워터마크가 적용됩니다.
제너레이티브 비디오 제어력의 확장: 제미나이 옴니 1.1 플래시
비디오 생성 영역에서는 개발자 제어 기능을 대폭 강화한 제미나이 옴니 1.1 플래시(Gemini Omni 1.1 Flash)가 공개되었습니다. 과거 모델이 직전 1초 분량의 컨텍스트만 참조했던 것과 달리, 옴니 1.1은 최대 10초의 이전 맥락을 분석하여 장면을 연장할 수 있습니다.
- 장면 연장(Scene Extension): 10초 단위로 영상을 확장하여 누적 최대 40초 길이의 일관된 샷 생성 가능
- 시작 및 종료 프레임 보간: 첫 프레임과 마지막 프레임을 지정하여 끊김 없는 카메라 궤적 이동 및 줌 화면 전환 구현
- 360p 초안 모드: 표준 720p 해상도 대비 최대 60% 빠른 속도와 3분의 1 비용으로 프로토타입 렌더링 지원
- 4K 업스케일링: 최종 결과물을 전문 제작용 1080p 및 4K 해상도로 고화질 변환
- 비디오 참조 멀티모달 입력: 최대 3초 길이의 비디오 레퍼런스를 참조하여 캐릭터와 시각적 스타일 일관성 유지
"Figma Weave에서 제미나이 옴니 플래시는 가장 강력한 비디오 모델 중 하나입니다. 연장 기능과 풍부한 참조 자료, 4K 해상도를 통해 단순 비디오 생성을 넘어 진정한 연출이 가능해졌습니다." — 이타이 시프(Itay Schiff), Figma Weave 크리에이티브 디렉터
이 기능은 어도비 파이어플라이(Adobe Firefly), 런웨이(Runway), GMI 클라우드 등 주요 창작 툴에 연동되어 프로덕션 환경에 즉시 투입되었습니다.
에이전틱 비디오 이해: 토큰 소모 88% 감축과 동적 스캔
기존 비디오 분석 AI는 고정된 초당 프레임 수(기본 1 FPS)로 전체 영상을 일괄 처리하는 '정적 분석' 방식을 사용했습니다. 이는 장시간 영상 분석 시 막대한 토큰 비용을 유발하고 미세한 순간을 놓치는 한계가 있었습니다.
새롭게 도입된 에이전틱 비디오 이해(Agentic Video Understanding)는 모델이 에이전트 루프 안에서 내부 도구를 활용해 필요한 영상 구간을 동적으로 탐색합니다.
- 사용자 질의 입력
- 목표 구간 동적 식별
- FPS 재샘플링 및 멀티모달 도구 호출
- 정밀 분석 및 결과 반환
이 기술은 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트에 적용되었습니다. 표준 비디오 분석 벤치마크에서 기존 정적 처리 대비 다음과 같은 성능 개선을 달성했습니다.
- 토큰 소비량 최대 88% 감축
- 분석 비용 최대 66% 절감
- 분석 정확도 최대 7% 향상
초 단위 미만의 정밀 순간 검색(Sub-second moment retrieval), 다시간 분량의 영상 내 '바늘 찾기(Needle-in-a-haystack)' 질의, 이상 징후 탐지를 위한 국소 프레임 재샘플링 등에서 개발자가 직접 프레임 파싱 파이프라인을 구축하지 않고도 API 설정에서 `agentic` 옵션을 활성화하는 것만으로 동일한 최적화를 구현할 수 있습니다.