6주간 이어진 3번의 플래시 출시, 구글의 새로운 코딩·보안 표준
구글 딥마인드가 제미나이 3.7 플래시 출시 3주 만에 차세대 경량 모델인 제미나이 3.8 플래시(Gemini 3.8 Flash)와 사이버 보안 전용 모델인 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)를 공식 발표했습니다. 이는 단 6주 동안 3개의 플래시 모델을 연이어 선보인 것으로, 프론티어급 성능을 플래시 라인업 특유의 저지연·저비용 구조로 구현하려는 전략의 일환입니다.
제미나이 3.8 플래시는 소프트웨어 엔지니어링, 에이전트 워크플로우, 다단계 추론(Multi-step reasoning) 영역에서 대폭 향상된 성능을 제공합니다. 장기 추론 소프트웨어 엔지니어링 벤치마크인 DeepSWE v1.1에서 3.8 플래시는 고비용 프론티어 모델 다수를 상회하는 자율 엔지니어링 문제 해결 능력을 기록했습니다. 고난도 다학제 추론 평가인 HLE-Verified에서는 54.9%를 달성했으며, 금융 분석 벤치마크(Vals Finance Agent V2) 및 법률 에이전트 벤치마크(Harvey's Legal Agent Benchmark)에서도 3.7 플래시와 기존 상위 모델들을 앞섰습니다.
이러한 성능 향상은 모델이 복잡한 작업 시 더 많은 추론 토큰을 소모하고 도구를 반복 호출하는 방식으로 작동 강도(effort level)를 동적으로 높인 설계에서 비롯됩니다. 개발자는 연산 효율이 중요한 경우 추론 수준(low, medium, high)을 직접 조정할 수 있습니다.
| 모델 구분 | 입력 토큰 ($/1M) | 출력 토큰 ($/1M) | 주요 특화 영역 |
|---|---|---|---|
| 제미나이 3.8 플래시 | $0.75 (정가 $1.50) | $3.75 (정가 $7.50) | 범용 에이전트, 고난도 소프트웨어 개발, 다단계 복합 추론 |
| 제미나이 3.8 플래시 사이버 | 별도 프로그램(Fairwind) 공급 | 별도 프로그램 공급 | 취약점 자율 탐지, CWE 패치 생성, 방어 보안 인프라 |
방어자 전용 보안 모델: 제미나이 3.8 플래시 사이버와 Fairwind 프로그램
함께 공개된 제미나이 3.8 플래시 사이버는 공격용 익스플로잇보다 방어적 역량인 '취약점 탐지 및 자동 패치'에 우선순위를 두고 설계된 보안 특화 모델입니다. 구글은 신뢰할 수 있는 정부 기관, 인프라 운영사, 오픈소스 관리자에게 선별적으로 접근 권한을 부여하는 Fairwind 프로그램을 가동했습니다.
- CyberGym 벤치마크: 자율 취약점 발견 평가에서 3.5 플래시 사이버 및 대형 프론티어 모델들을 능가하는 성과를 기록했습니다.
- 20개 언어 사내 벤치마크: C/C++에 한정되지 않고 20개 프로그래밍 언어로 구성된 복합 코드베이스에서 70% 이상의 취약점 탐지 성공률을 달성했습니다.
- CWE-Bench 패치 성능: Collinear가 주관하는 취약점 패치 벤치마크에서 pass@1 47.2%를 달성해 프론티어 선도 모델(47.8%) 수준의 파레토 최적선을 확보했습니다.
- 실제 배포 성과: 크롬(Chrome) 보안팀 평가 결과 상용 대형 모델 대비 2.6배 높은 정확도의 패치를 생성했으며, 클라우드 취약점 연구팀은 일반적으로 수개월이 소요되는 중대 기반 취약점을 2시간 미만에 탐지했습니다. 클라우드 보안 기업 위즈(Wiz) 침투 테스트 벤치마크에서는 기존 프론티어 모델 대비 2.3~5.2배 낮은 비용으로 7.5~9.7% 높은 재현율(Recall)을 기록했습니다.
컴퓨터 직접 조작 평가인 OSWorld-2.0에서는 3.7 플래시 대비 개선되었으나 클로드 오푸스(Claude Opus) 대비로는 여전히 격차가 존재하는 것으로 확인되었습니다.
제미나이 옴니 1.1 플래시: 정밀 제어 가능한 생성형 비디오 워크플로우
구글은 시각 미디어 생성 영역에서도 전문 제작 환경에 맞춘 제미나이 옴니 1.1 플래시(Gemini Omni 1.1 Flash)를 출시했습니다. 이전 버전이 1초 내외의 직전 맥락만 참조했던 한계를 넘어, 최대 10초의 이전 맥락을 분석하여 자연스러운 서사를 유지하는 씬 확장 기능을 지원합니다.
- 초기 프롬프트 및 비디오 참조(최대 3초)
- 360p 고속 프리뷰 렌더링
- 시작/종료 키프레임 보간
- 최대 40초 씬 확장
- 4K/1080p 최종 업스케일링
옴니 1.1 플래시가 제공하는 핵심 제어 기능은 다음과 같습니다:
- 최대 40초 씬 확장: 10초 단위로 연속해서 씬을 연장할 수 있으며 최대 누적 40초 길이의 비디오를 생성합니다.
- 시작 및 종료 프레임 지정(Keyframe Interpolation): 첫 프레임과 마지막 프레임을 지정하면 모델이 두 시점 사이를 매끄럽게 보간(In-betweening)하여 점프 컷 없는 카메라 패닝 및 궤도 회전(Orbital rotation)을 구현합니다.
- 360p 저비용 고속 프리뷰: 표준 720p 대비 최대 60% 빠른 속도와 3분의 1 비용으로 초안을 렌더링할 수 있어 스토리보드 반복 검증 비용을 줄였습니다.
- 4K 초고해상도 업스케일링: 최종 승인된 씬을 1080p 또는 4K 해상도로 변환하여 상용 미디어 수준의 해상도를 출력합니다.
- 3초 비디오 멀티모달 레퍼런스: 최대 3초 분량의 참조 영상을 입력하여 등장인물의 시각적 일관성과 동작 스타일을 유지합니다.
현재 어도비 파이어플라이(Adobe Firefly), 피그마 위브(Figma Weave), 런웨이(Runway), GMI Cloud 등이 옴니 1.1 플래시 API를 프로덕션 워크플로우에 통합했습니다.
에이전틱 비디오 이해: 토큰 소모 88% 절감과 능동적 영상 스캔
기존 비디오 분석 방식은 초당 고정 프레임(예: 1 FPS)으로 전체 영상을 일괄 디코딩하여 불필요한 토큰 소비가 컸습니다. 구글이 도입한 에이전틱 비디오 이해(Agentic Video Understanding)는 모델이 에이전트 루프 안에서 비디오 도구를 능동적으로 호출하여 필요한 구간, 프레임 레이트, 모달리티(영상 프레임, 오디오, 트랜스크립트)를 스스로 선택해 탐색합니다.
"에이전틱 비디오 이해를 활성화하면 제미나이 3.7 플래시 기준으로 분석 비용을 최대 66%, 토큰 소모를 최대 88% 줄이면서도 정확도는 최대 7% 향상됩니다."
이 기능은 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트(Flash-Lite) 모델의 API 설정에서 `agentic` 옵션을 켜는 것만으로 추가 요금 없이 적용됩니다.
- 서브세컨드(Sub-second) 순간 검색: 1 FPS 단위에서 놓치기 쉬운 1초 미만의 상태 변화와 컷 경계면을 정밀하게 탐지합니다.
- 장문 비디오 Needle-in-a-Haystack 검색: 수 시간 분량의 영상에서 수백만 토큰을 소모하지 않고 특정 단서와 정답을 추출합니다.
- 동적 FPS 이상 탐지(Anomaly Detection): 움직임이 빠른 구간을 감지하면 해당 시간대만 높은 FPS로 리샘플링하여 시각적 결함을 분석합니다.
- 정밀 카운팅: 반복되는 물리적 동작이나 고속 움직임을 동적 프레임 스캔으로 계측합니다.
이 기능은 구글 AI 스튜디오 및 엔터프라이즈 플랫폼 외에도 일반 제미나이 앱과 유튜브의 'Ask YouTube' 질의응답 기능에 순차 배포될 예정입니다.
로컬 및 에이전트 도구 생태계의 실증 결과
오픈소스 LLM CLI 생태계를 주도하는 개발자 사이먼 윌리슨(Simon Willison)의 실측에 따르면, 제미나이 3.8 플래시는 사고 강도(thinking level) 파라미터 조절을 완벽히 지원하며 HTML/자바스크립트 코드 생성에 강력한 역량을 입증했습니다.
- 코드 생성 실측: 단일 프롬프트로 복합 HTML 시각화 결과물을 13초 만에 생성했으며 소요 비용은 1.8센트($0.018)에 불과했습니다.
- 코딩 에이전트 연동: `llm-coding-agent` 플러그인을 통해 제미나이 3.8 플래시가 기존 Markdown SVG 렌더러에 격리된 iframe 기반 HTML 블록 렌더링 기능을 자동으로 추가 및 패치하는 데 성공했습니다.
구글은 Google Antigravity 환경에서 3.8 플래시 단일 프롬프트로 완전 작동 가능한 DOS 버전 구글 맵, 미국 지질조사국(USGS) 데이터 기반 실시간 3D 단면 지형도, 3D 하드웨어 분해도 시각화(Hardware Anatomy) 도구를 빌드할 수 있음을 확인했습니다. 이는 모델의 추론 루프가 복잡한 스크립트 작성 및 구조화된 UI 생성을 실시간으로 처리할 수 있는 수준에 도달했음을 보여줍니다.